動画コーデック直結型トークン化で挑む次世代オープンLMM「LLaVA-OneVision-2」:ビットコスト適応配分と共有3D RoPEが拓く高精度時空間認識
LLaVA-OneVision-2は、動画圧縮コーデックのメタデータを直接解析し視覚トークンを動的配分する「Codec-Stream Tokenization」を導入した最新のオープンLMM。均一サンプリングの計算浪費を排除し、高精度な時空間認識を実現する設計思想と実装パイプラインを詳解する。
LLaVA-OneVision-2は、動画圧縮コーデックのメタデータを直接解析し視覚トークンを動的配分する「Codec-Stream Tokenization」を導入した最新のオープンLMM。均一サンプリングの計算浪費を排除し、高精度な時空間認識を実現する設計思想と実装パイプラインを詳解する。