#人工智慧 #kimi K3 #VLM

原生視覺智慧的特殊之處:

為何 MoonViT-V2 與眾不同

Agnostic Invention Team|2026-08-06


一、VLM 讓 AI 看見世界,但也埋下架構限制

大多數多模態 AI 就像一個「後天學語言的外國人」——先學會了一門語言(文字),再去學另一門(視覺),兩者之間永遠需要翻譯。你說的話需要翻譯成他聽得懂的語言,他的回應又需要翻譯回來,過程中難免有所失真。MoonViT-V2 的「原生」,意味著它從一開始就同時學習文字與視覺,兩者在同一個神經網路中共同成長,不需要翻譯,也不存在語言隔閡。這一根本差異,決定了它與傳統多模態模型之間的本質距離。



二、傳統方法的根本問題

傳統多模態模型的主流做法,是先訓練一個視覺編碼器(如 CLIP 或 SigLIP),再將其與語言模型對接。這個方法看似合理,卻在根本上埋下了三個深層問題。

1

對齊損失

CLIP 與 SigLIP 的訓練目標是「圖文對比學習」——讓一張貓的圖片和「一隻貓」這個句子在向量空間中靠近。這個目標優化的是語意標籤的相似度,而非對圖像細節的深度理解。換句話說,這類編碼器天生擅長識別「這是什麼」,卻不擅長理解「這裡有什麼細節」或「這張圖表達了什麼邏輯」。

2

表示瓶頸

預訓練視覺編碼器的表示空間在訓練結束後便固定下來,語言模型只能在這個已固定的空間內工作,無法根據語言建模的實際需求重新塑造視覺表示。這就像是請一位只會說方言的翻譯——不管你需要什麼,他只能給你他會說的那種語言。

3

訓練割裂

視覺編碼器與語言模型分開訓練,兩者的梯度從未真正互相影響。視覺層不知道語言模型需要什麼,語言模型也無法告訴視覺層該注意哪些特徵。這種割裂使得深層的跨模態推理能力受到根本性的限制。














三、原生訓練的核心差異

MoonViT-V2 選擇了一條截然不同的道路,其核心差異體現在三個層面。

  1. 目標一致
    MoonViT-V2 使用「下一個 token 預測」作為訓練目標,與語言模型完全相同。這意味著視覺特徵的學習方向,從一開始就服務於「語言建模需要什麼」,而非「圖文對比需要什麼」。當模型試圖預測「圖中的文字是什麼」或「這張圖表下一步應該描述什麼」時,視覺編碼器自然而然地學會提取語言建模真正需要的細節,而非僅僅是語意標籤。
  1. 梯度貫通
    在 MoonViT-V2 的訓練過程中,視覺 Transformer 與語言模型的梯度完全貫通——視覺層的每一個參數都會根據語言建模的損失進行調整。這不是一個比喻,而是字面意義上的「語言告訴視覺該怎麼看」。這種深度耦合使得視覺表示能夠自然地演化為語言模型最需要的形式,兩者逐漸形成一套共同的「內部語言」。
  1. 統一 token 流
    圖像、影片與文字被轉換為同一種 token,在同一個序列中共同處理。模型不需要知道「這是圖像 token」還是「這是文字 token」——它只需要預測下一個 token,無論那個 token 來自哪種模態。這種設計徹底消除了模態之間的邊界,讓視覺理解與語言推理在最底層的機制上融為一體。


四、訓練穩定性:從頭訓練的最大挑戰

從頭訓練聽起來理所當然,但在工程實踐中,它面臨著一個嚴峻的挑戰:訓練穩定性。預訓練視覺編碼器提供了一個穩定的初始化起點,視覺網路從一開始就有合理的參數分佈,梯度不容易爆炸或消失。然而,從頭訓練意味著視覺網路從隨機初始化開始,在訓練初期極容易出現數值不穩定的問題,一旦梯度爆炸,整個訓練過程便可能崩潰。

Kimi K3 的技術報告提供了一個直接而有力的證據:梯度範數曲線。在整個訓練過程中,從頭訓練的梯度範數保持平穩,而使用預訓練初始化的方案則出現了明顯的梯度不穩定現象。這個結果反直覺,卻有其深刻的邏輯:當視覺網路與語言模型從一開始就共同訓練時,兩者能夠自然地摸索出彼此相容的表示空間與梯度尺度,反而比「強行對齊兩個獨立訓練的網路」更加穩定。兩個陌生人從零開始一起建立默契,有時比兩個各有習慣的人被迫搭檔更容易合作。




五、原生多模態的實際意義

原生訓練的哲學差異,最終體現在三個具體的能力優勢上。

  1. 細節理解
    由於視覺特徵直接服務於語言建模的需求,MoonViT-V2 能夠理解圖像中的細節文字、複雜圖表與技術示意圖,而不只是識別「這是一張貓的圖片」或「這是一個條形圖」。當模型被訓練成要預測「圖中第三行寫著什麼」時,它自然學會了精確定位與閱讀圖像中的文字資訊。
  1. 影片理解
    MoonViT-V2 同時處理圖像與影片輸入,影片幀被視為時間序列中的視覺 token,與其他 token 一同在序列中流動。模型能夠理解跨幀的動態變化——某個物體的移動軌跡、某個事件的發展過程——而非只是對每一幀做獨立的靜態識別。時間維度的理解,成為多模態推理的一個自然延伸。
  1. 上下文視覺推理
    在 100 萬 token 的超長上下文視窗中,視覺 token 與文字 token 共存於同一個序列。模型能夠在一份包含數十張圖表的長篇報告中,定位特定圖像、引用其內容、並在文字推理中加以運用,實現真正的長上下文多模態理解。這是傳統「視覺編碼器搭配語言模型」的架構難以企及的能力邊界。

「原生」不只是一個技術標籤,而是一種訓練哲學的根本轉變——從「讓語言模型學會看圖」,到「讓視覺與語言從一開始就共同學習理解世界」。MoonViT-V2 的特殊之處,不在於它有多少參數,也不在於它的架構有多精巧,而在於它的視覺智慧與語言智慧從未分離過。這種從未分離,正是它理解世界的方式,也是它與眾不同的根本所在。


All Rights reserved to META AI™|英登股份有限公司