Looped Transformerと潜在推論のアーキテクチャ設計:GPT-6 Astra報道の論点とSMELT・仮想論理深度による計算効率スケーリング則
OpenAI「GPT-6 Astra」の再帰的深度報道を契機に、重み共有型Looped Transformerと潜在推論の理論的背景および実装手法を整理。SMELT論文が提示した計算量適合MoEスケーリング則、仮想論理深度による知識記憶と推論機能の分離、およびKLダイバージェンス判定による適応的早期終了の実装設計を詳解する。
OpenAI「GPT-6 Astra」の再帰的深度報道を契機に、重み共有型Looped Transformerと潜在推論の理論的背景および実装手法を整理。SMELT論文が提示した計算量適合MoEスケーリング則、仮想論理深度による知識記憶と推論機能の分離、およびKLダイバージェンス判定による適応的早期終了の実装設計を詳解する。