軽量350Mモデルを100ステップのGRPOで最適化する:TRLを用いたJSON構造化出力特化の強化学習実践
Liquid AIの超軽量モデル「LFM2.5-350M」を対象に、TRLのGRPO(Group Relative Policy Optimization)を用いて構造化データ生成精度を向上させる実践レシピです。16GB VRAM環境下、わずか100ステップの強化学習により、IFStructスコアを22.6%から29.7%へ改善した検証結果と実装詳細を解説します。
Liquid AIの超軽量モデル「LFM2.5-350M」を対象に、TRLのGRPO(Group Relative Policy Optimization)を用いて構造化データ生成精度を向上させる実践レシピです。16GB VRAM環境下、わずか100ステップの強化学習により、IFStructスコアを22.6%から29.7%へ改善した検証結果と実装詳細を解説します。