単一双方向Transformerで挑むマルチモーダル・ネイティブエンコーダ「NeoMME」:Vision塔・Causal LMの排除と255倍インデックス圧縮が拓く高速Visual RAG
H Companyが公開した「NeoMME」は、独立したVisionエンコーダやCausal LLMを排し、単一の双方向Transformerで画像とテキストを直接処理する軽量エンコーダです。階層的トークンプールと非対称量子化によりインデックスサイズを1/255に圧縮し、低コストかつ高スループットなVisual RAGを実現します。