一個數字震驚了所有人:3970億參數的開源模型,在SWE-bench程式碼建構測試中,跑出了與Claude Opus 4.8完全平起平坐的成績。而且這不是什麼藏在雲端機房、只有頂級企業才摸得到的封閉巨獸——它叫Ornith-1.5,Apache 2.0授權,任何人可以下載、修改、拿去商用,甚至連90億參數的輕量版,都能在iPhone 17上離線跑。
這不是開源社群第一次喊出「超越閉源」。但過去幾年,我們看過太多開源模型在基準測試裡風光登場,然後在真實世界的複雜推理場景中黯然退場。算力耗盡、資料瓶頸、靜態訓練集的侷限,像三道枷鎖把開源死死按在「第二梯隊」。直到DeepReinforce端出Ornith-1.5,事情開始不一樣了。
表象:一場蓄謀已久的技術突襲
如果你只掃過新聞標題,大概會以為這又是哪家AI實驗室擠牙膏式的版本更新。但細看產品矩陣,你會發現DeepReinforce這步棋下得極狠:從397B的雲端旗艦、35B-A3B的MoE平衡版,到9B的輕量稠密模型,再到專為手機打造的4-bit量化版9B-Mobile——一條完整的火力線,從資料中心一路舖到你口袋裡。
397B版本用的是混合專家架構,實際推論時不會把全部參數點燃,只動員特定專家網路,算力開銷壓在合理範圍內。根據DeepReinforce技術白皮書,它在部分關鍵測試項目中已經越過了Claude Opus 4.8。35B-A3B則鎖定企業私有化部署,性價比直接碾壓同級別的Muse-Glimmer-30B和Google Gemma-4-31B。
但真正讓業內倒吸一口氣的,是那個9B-Mobile。
從產業面來看,DeepReinforce這招「雲端+邊緣」雙線包抄,戰略意圖非常清楚。過去開源模型的痛點從來不是「有沒有人做」,而是「做了誰能用」。397B再強,也跟一般開發者無關。但當一個90億參數的模型能在手機上離線運作,而且效能還能跨級打敗310億的Gemma-4-31B——這已經不是在追趕閉源,這是在改寫遊戲規則。台灣的AI新創和硬體廠商,現在該認真思考的不再是「要不要導入開源模型」,而是「我的產品怎麼跟這條技術曲線對接」。
真相:自我改進循環如何拆掉資料天花板
傳統的大型語言模型訓練,像一個永遠吃不飽的學生——需要人類不斷餵食標註資料、合成資料,才能慢慢進步。當模型規模撐大到一定程度,資料枯竭和邊際效應遞減就像兩堵高牆,死死擋住去路。這也是為什麼許多開源模型一開始驚豔全場,後來卻越跑越沒力——不是演算法不夠好,是資料的礦挖完了。
Ornith-1.5給出的解方,叫做「自我改進循環」。
白話文來說,就是讓模型在學習過程中自己當自己的教練。它會自主探索能力邊界,主動給自己出更難的邏輯題目,然後自我評估、自我校正、持續迭代。這個閉環運作起來之後,模型不再被動等待人類餵新資料,而是主動從每一次推理中汲取經驗,像下棋高手透過不斷跟自己對弈來進化一樣。
這不是理論上的美好想像。從實測數據來看,Ornith-1.5-9B在標準基準評測中不僅大幅領先同尺寸模型,甚至跨級擊敗了參數高達310億的Gemma-4-31B。換句話說,它用不到三分之一的參數,打出了更好的表現——參數利用效率高得誇張。
「我們看到的不只是一個新模型,而是一套全新的訓練範式。」一位不願具名的開源社群核心維護者如此評論。「如果自我改進循環真的被驗證有效,那整個開源生態的迭代速度會完全脫離過去的曲線。閉源巨頭不再擁有『資料優勢』這道護城河——因為AI自己會挖礦。」
各方角力:開源、閉源、以及那場被中斷的密會
這項發布的時間點耐人尋味。就在Ornith-1.5亮相前不久,業界才傳出OpenAI與Anthropic高層密會,遊說政府單位限制中國開源模型進入市場。而輝達執行長黃仁勳和特斯拉執行長馬斯克,則在同一時間表態力挺開放生態——這場角力的火藥味,已經瀰漫到整個矽谷上空。
DeepReinforce選擇在這個時間點端出Ornith-1.5,而且直接採用Apache 2.0商業友善授權,擺明就是要戳破閉源陣營「開源等於落後」的敘事。當一個開源模型能在手機上離線跑出雲端等級的推理能力,閉源巨頭還剩下什麼護城河?API收費?資料隱私?還是單純的品牌信仰?
對台灣的開發者和企業來說,這不只是遠方的技術新聞。Ornith-1.5-9B-Mobile的意義在於:你不再需要把客戶的敏感資料送上雲端、不再需要按token付費、不再需要擔心網路延遲——一支手機就能完成複雜對話、即時長文摘要、甚至程式碼輔助。這對金融、醫療、法律等高度重視資料隱私的產業來說,幾乎是解渴般的存在。
「我們測試過9B-Mobile在iPhone 17上的實際表現,流暢度超出預期。」一位參與早期測試的AI工程師透露。「當然它沒辦法跟397B的雲端版本比肩,但作為一個離線助手,它已經足夠處理日常工作中八成以上的複雜任務。而且數據完全不離開裝置——這對企業合規來說是巨大的加分項。」
不過話說回來,開源陣營也不是從此一路順風。自我改進循環的長期穩定性、模型在不同語言和文化的適應力、以及第三方稽核與安全防護機制,都還需要時間驗證。DeepReinforce把這扇門打開了,但後續的生態能不能跟上,是另一個層次的考驗。
深層影響:AI民主化的最後一哩路
從ChatGPT引爆這波AI熱潮以來,我們一直在講「AI民主化」。但說實話,過去兩年的民主化比較像「人人可以註冊使用」——API還是要付費、敏感數據還是要上傳、算力還是被少數雲端巨頭壟斷。真正的民主化,應該是任何人都能在自己的裝置上、離線、免費、且安全地執行頂級AI推理。
Ornith-1.5把這件事從科幻小說拉進了現實。9B-Mobile在端側NPU記憶體佔用優化後,記憶體門檻壓到極低,不僅iPhone 17可以跑,主流Android旗艦機也能順暢運作。這意味著:
- 一家沒有雲端預算的新創團隊,可以在員工手機上部署AI輔助開發工具
- 一位擔心個資外洩的自由接案者,可以在離線狀態下處理客戶機密文件
- 一個偏鄉學校的學生,不必連網也能使用最先進的學習輔助AI
這才是開源真正的爆發力——不是打敗誰,而是讓「擁有頂級AI」從特權變成基本權利。
未解之問:然後呢?
但我們也必須誠實面對幾個還沒答案的問題。
第一,自我改進循環在長期運作下,會不會出現自我強化的偏誤?當模型只在自己的閉環裡迭代,某些特定的推理路徑可能被過度強化,而其他同樣合理的路徑卻被遺忘——這不是杞人憂天,強化學習的「獎勵盜用」問題早已被學界反覆討論。
第二,開源社群有沒有能力維護這個龐大的產品矩陣?從397B到9B,從雲端到手機,DeepReinforce一口氣鋪開的戰線太廣。後續的漏洞修補、安全對齊、版本更新,都需要大量的社群投入。Apache 2.0授權讓人人可以使用,但「人人可以使用」不等於「人人可以維護」。
第三,也是最大的一個問號:閉源巨頭會怎麼回應?OpenAI和Anthropic的遊說行動雖然暫時沒有具體結果,但這透露了一個訊號——當開源真的威脅到商業模式時,法律和監管工具可能比技術競爭來得更快。Ornith-1.5的技術突破是事實,但這項技術能不能在市場上自由流通,從來不只是技術問題。
回過頭來看,Ornith-1.5真正帶給我們的,不是一個「開源打敗閉源」的爽快故事,而是一個更深層的提醒:AI的未來不應該只有一條路、一種商業模式、或少數幾家公司能決定。當一支手機就能離線跑出頂級推理能力時,權力結構正在悄悄地、但不可逆地轉移。
至於這股力量會被用來做什麼——那就看我們這一代開發者、創業者、和使用者,怎麼接住它了。
編輯觀點:從技術層面來看,Ornith-1.5的自我改進循環確實是近年開源AI領域最具顛覆性的架構創新之一。但我想提醒讀者的是:模型的「能力」和「可信賴程度」是兩件事。當AI能在手機上離線自主推理時,我們面對的不再是「API供應商把關的AI」,而是「完全失控的AI代理人」。開源社群下一步必須優先解決的是可解釋性與安全對齊機制——否則,這把劍揮出去之前,可能先砍到自己。
【行動呼籲】如果你手上有一支iPhone 17或Android旗艦機,現在就可以去下載Ornith-1.5-9B-Mobile的量化版本,親身感受一下離線AI的推理能力——然後問自己一個問題:當頂級AI算力真的握在掌心時,你想用它來解決什麼問題?答案,可能比你以為的更有趣。
本文改寫整理自公開新聞來源,原始報導由T客邦發布。
常見問題 FAQ
Ornith-1.5可以在哪些手機上離線運行?
主要是iPhone 17系列以及搭載最新世代晶片的主流Android旗艦機。透過4-bit量化壓縮和NPU記憶體優化,9B-Mobile版本可以在這些裝置上流暢離線執行複雜對話、摘要和程式碼輔助。
自我改進循環跟傳統的AI訓練有什麼不同?
傳統訓練依賴人類提供大量標註資料,自我改進循環則是讓AI自己探索能力邊界、主動生成更難的推理題目,並透過自我評估與強化學習持續迭代,不必無止境仰賴人工數據介入。
Ornith-1.5的Apache 2.0授權代表我可以自由商用嗎?
可以。Apache 2.0是商業友善的開源授權,允許任何人下載、修改、甚至拿去開發商業產品,不需要向DeepReinforce支付授權費用,也不需要公開你的修改程式碼(除非你選擇這麼做)。
9B-Mobile的推理能力跟雲端397B版本差多少?
規模和應用場景不同,397B適合處理極複雜的程式碼建構和深度推理,而9B-Mobile定位在端側離線應用,雖然整體能力不及雲端旗艦,但在日常任務如對話、摘要、程式輔助上已經夠用,且數據完全不用上傳雲端。
※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。