Agnostic Invention Team|2025-04-16
隨著大型語言模型(Large Language Models, LLM)如 ChatGPT、Claude、Gemini 等快速演進,我們越來越常看到它們應用於文書處理、客服自動化等任務。然而,LLM 不僅僅是「文字理解工具」,更可視為一種具備「世界模型(World Model)」的智慧體。
透過世界模型,LLM 不僅能回答問題,還能預測物理事件、模擬環境互動、控制實體裝置。為了驗證 LLM 是否具備這樣的「世界理解能力」,我們實作了一個經典控制任務:「倒單擺」(Inverted Pendulum)— 也就是讓一根倒立的桿子在一台可以滑動的小車上保持垂直不倒。
這個任務的關鍵在於馬達的精準控制:小車的移動仰賴底部馬達輸出驅動力,若單擺開始傾斜,馬達必須即時產生適當的推力,讓小車移動到對的位置,以抵消擺動所造成的力矩。換句話說,倒單擺就是馬達控制問題的縮影,結合了感測、預測與行動的即時調控。
這不只是機器人控制的入門問題,也是一個觀察 AI 如何學會控制馬達、推理物理狀態、達成平衡的合適範例。
什麼是世界模型?
世界模型是指一種 AI 內部對「外部世界運作方式」的理解與模擬能力。根據經驗或觀察建立起因果關係(例如:施力會造成移動、角度變化會導致平衡失敗),進而預測接下來會發生什麼,並規劃最合適的行動。
為了讓大型語言模型(LLM)或其他 AI 模型能夠理解並控制一個物理系統,我們需要將「現實世界」轉化為一個 AI 可以學習的結構化流程。整體邏輯可以想像成這樣:
我們先建立一個虛擬的世界 → 再定義這個世界的物理規則與互動方式 → 讓 AI 在這個世界中反覆嘗試與學習 → 最後驗證它是否真的學會如何控制這個世界的運作。
在這次倒單擺控制實驗中,我們將這個學習任務拆解為以下四個核心階段:
從零開始設計了一個客製化的模擬環境,使用 Gym 框架作為基礎。這個模擬世界模仿真實物理情境:小車可以在水平方向移動,車上裝有一根單擺,目標是讓這根單擺保持直立。在這個階段中,我們明確定義了:
這些參數使得模擬系統能真實反映物理運動規律,成為 AI 模型進行互動與學習的「實驗室」。
接下來,我們設計了動作控制與獎勵邏輯,也就是告訴 AI:「你要做什麼樣的事,才算成功」。 這部分包括:
這些規則是 AI 判斷「每一步動作效果」的依據,也就是所謂的 Reward Function(獎勵函數),是強化學習中最核心的設計元素。
在有了環境與規則之後,我們使用了當今最常見的強化學習演算法之一:PPO(Proximal Policy Optimization,近端策略優化),來訓練 AI 模型。
訓練的過程可以比喻成小孩學走路:AI 不斷嘗試、失敗、再修正。模型會根據每次嘗試的結果更新策略,使模型在未來遇到相似情境時能做出更好的決策。
我們設定的關鍵參數包括:
透過數萬次的模擬與學習,AI 模型最終能穩定控制小車移動,使單擺維持直立,達成從經驗中建立世界模型並做出最佳控制策略的目標。
最後,我們將訓練好的模型進行反覆測試,並將整個控制過程以動畫方式呈現。

透過動態圖像可清楚觀察:
什麼是 Gym?
Gym 是由 OpenAI 開發的一個強化學習模擬環境套件,提供了標準化的「觀察空間(Observation Space)」、「動作空間(Action Space)」、「獎勵機制(Reward Function)」與「環境狀態轉移邏輯」,讓研究者可以快速建構出可供 AI 互動與訓練的虛擬世界。你可以把 Gym 想像成 AI 專屬的「虛擬實驗室」,在這裡,AI 能像小孩一樣學習嘗試、犯錯、修正,最終掌握控制邏輯。
什麼是 PPO?
PPO 是一種策略型強化學習演算法,能在每次更新時「穩定而小幅地調整行為策略」,避免過度學習導致表現不穩定。相比傳統演算法,PPO 結合了學習效率與穩定性,廣泛應用於機器人控制、遊戲 AI、自駕車模擬等領域。透過「限制更新幅度」的方式,確保每一次學習都是朝向更好的方向,但又不會偏離太遠,類似於「一步步修正行為的安全學習法」。
這次倒單擺的控制實驗雖然是個簡單的測試場景,更重要的是實質展現了一個重要的突破:語言模型(LLM)不再只是對話工具,而是具備理解世界規則、主動控制實體裝置的智能中樞。
這個過程讓我們得以驗證,LLM 已逐步具備下列三項關鍵能力:
倒單擺控制任務只是第一步,讓我們親眼見證語言模型(LLM)從文字推理走向行動決策的可能性。當 AI 能夠理解世界模型、透過語言驅動控制行為,並具備泛化能力處理多樣環境變數時,智慧系統的定義與邊界將被徹底改寫。
未來,我們不再需要手動設計複雜的邏輯流程與控制函數,只要透過語言溝通,AI 就能根據理解的目標與環境,自行調整策略,完成從感知到執行的完整閉環。這將為智慧製造、機器人協作、智慧物流、自駕載具、AI 助理型裝置等場景開啟全新篇章。
LLM 控制馬達不只是「語言驅動硬體」這麼簡單,代表的是 AI 開始具備介入現實世界、主動參與與決策的能力。語言模型將不只是資訊的編碼者與解碼者,而是逐漸成為整體系統的操控大腦,從接受指令、到理解任務、再到執行行動,完成人類語言與機器控制之間的最後一哩路。
這種「語言即行動」的能力,將不只改變 AI 的角色,也將改變開發者設計系統的方式、企業定義智慧的標準,乃至於人類與機器的互動模式,現在就是開始使用AI控制的最好時機。
All Rights reserved to META AI™|英登股份有限公司
#人工智慧 #LLM #機械控制