Agnostic Invention Team|2026-08-06
大多數多模態 AI 就像一個「後天學語言的外國人」——先學會了一門語言(文字),再去學另一門(視覺),兩者之間永遠需要翻譯。你說的話需要翻譯成他聽得懂的語言,他的回應又需要翻譯回來,過程中難免有所失真。MoonViT-V2 的「原生」,意味著它從一開始就同時學習文字與視覺,兩者在同一個神經網路中共同成長,不需要翻譯,也不存在語言隔閡。這一根本差異,決定了它與傳統多模態模型之間的本質距離。
傳統多模態模型的主流做法,是先訓練一個視覺編碼器(如 CLIP 或 SigLIP),再將其與語言模型對接。這個方法看似合理,卻在根本上埋下了三個深層問題。
CLIP 與 SigLIP 的訓練目標是「圖文對比學習」——讓一張貓的圖片和「一隻貓」這個句子在向量空間中靠近。這個目標優化的是語意標籤的相似度,而非對圖像細節的深度理解。換句話說,這類編碼器天生擅長識別「這是什麼」,卻不擅長理解「這裡有什麼細節」或「這張圖表達了什麼邏輯」。
預訓練視覺編碼器的表示空間在訓練結束後便固定下來,語言模型只能在這個已固定的空間內工作,無法根據語言建模的實際需求重新塑造視覺表示。這就像是請一位只會說方言的翻譯——不管你需要什麼,他只能給你他會說的那種語言。
視覺編碼器與語言模型分開訓練,兩者的梯度從未真正互相影響。視覺層不知道語言模型需要什麼,語言模型也無法告訴視覺層該注意哪些特徵。這種割裂使得深層的跨模態推理能力受到根本性的限制。
MoonViT-V2 選擇了一條截然不同的道路,其核心差異體現在三個層面。
從頭訓練聽起來理所當然,但在工程實踐中,它面臨著一個嚴峻的挑戰:訓練穩定性。預訓練視覺編碼器提供了一個穩定的初始化起點,視覺網路從一開始就有合理的參數分佈,梯度不容易爆炸或消失。然而,從頭訓練意味著視覺網路從隨機初始化開始,在訓練初期極容易出現數值不穩定的問題,一旦梯度爆炸,整個訓練過程便可能崩潰。
Kimi K3 的技術報告提供了一個直接而有力的證據:梯度範數曲線。在整個訓練過程中,從頭訓練的梯度範數保持平穩,而使用預訓練初始化的方案則出現了明顯的梯度不穩定現象。這個結果反直覺,卻有其深刻的邏輯:當視覺網路與語言模型從一開始就共同訓練時,兩者能夠自然地摸索出彼此相容的表示空間與梯度尺度,反而比「強行對齊兩個獨立訓練的網路」更加穩定。兩個陌生人從零開始一起建立默契,有時比兩個各有習慣的人被迫搭檔更容易合作。
原生訓練的哲學差異,最終體現在三個具體的能力優勢上。
「原生」不只是一個技術標籤,而是一種訓練哲學的根本轉變——從「讓語言模型學會看圖」,到「讓視覺與語言從一開始就共同學習理解世界」。MoonViT-V2 的特殊之處,不在於它有多少參數,也不在於它的架構有多精巧,而在於它的視覺智慧與語言智慧從未分離過。這種從未分離,正是它理解世界的方式,也是它與眾不同的根本所在。
All Rights reserved to META AI™|英登股份有限公司
#人工智慧 #kimi K3 #VLM