DAY 236 · 2026-08-23

開源到底追上閉源了沒

SLIDES · 8
Day 236 開源到底追上閉源了沒 — 投影片 1Day 236 開源到底追上閉源了沒 — 投影片 2Day 236 開源到底追上閉源了沒 — 投影片 3Day 236 開源到底追上閉源了沒 — 投影片 4Day 236 開源到底追上閉源了沒 — 投影片 5Day 236 開源到底追上閉源了沒 — 投影片 6Day 236 開源到底追上閉源了沒 — 投影片 7Day 236 開源到底追上閉源了沒 — 投影片 8
1 / 8

Day 235 我引的「6 到 9 個月」,是 Nathan Lambert 二月寫的。半年過去,中間開放權重的模型放出來一波又一波,我好奇他後來有沒有改口。

有。七月他把數字改成 3 到 5 個月,八月十四號最新那篇又寫了一次同一件事。二月、七月、八月這三篇擺在一起看,變的是月數,沒變的是論點——二月那篇的標題就是他的論點:〈Open models in perpetual catch-up〉,永遠在追。

這篇分享五件事:他這三篇前後改了什麼、蒸餾這條捷徑為什麼被封掉、為什麼「追上了沒」這個問題本身就問錯了、昨天那張 arena.ai WebDev 排行榜到底能代表多少,還有我自己用開源模型的經驗——榜上那個分數完全沒算到的維護成本。

先把三篇擺出來

時間 哪一篇 他給的落後幅度
2026 年 2 月 17 日 Open models in perpetual catch-up 6 到 9 個月
2026 年 7 月 20 日 Kimi K3: The open-weights escalation 3 到 5 個月
2026 年 8 月 14 日 GLM-5.3: How Chinese labs keep stride with the frontier 沒再給新數字,論點照舊

中間那一行就是他改口的那次。七月二十號寫 Kimi K3 那篇的時候,他直接把自己二月的數字改掉:

The key fact is that either the open-to-closed or American-to-Chinese model performance gap has been reduced from the debated 6-9 months to something shorter, say 3-5 months.

所以我昨天拿排行榜去反駁二月那個說法,而那個數字他一個多月前就已經自己改過了。

但他改的是月數。論點一個字都沒改——表格外,四月他另外還寫過一篇,把 perpetual catch-up 原話搬出來,說那是「當下的均衡」。八月十四號最新那篇,講的還是同一套。

從 6 到 9 個月縮到 3 到 5 個月,聽起來像好消息。但月數本身不是重點,重點是這個數字衡量的是什麼:開源模型要花多久,才做得到「某個時間點的閉源模型」做得到的事。

追上的,永遠是幾個月前的那一版

Lambert 的論點寫在標題裡:不是「還沒追上」,是「永遠在追」。原句是——

The best closed models keep unlocking even more valuable tasks, keeping open models in a state of perpetual catch-up.

最好的閉源模型持續解鎖更有價值的任務,讓開源模型一直處在追趕的位置。

說白了是這樣:不管是 6 到 9 個月還是 3 到 5 個月,比較基準都是「當時的閉源模型」。開源今天追平的,是閉源幾個月前做到的事;等它追平,閉源那條線已經又往前移了。

所以就算月數一路縮到零,也不代表兩邊站在同一個位置——只代表追的速度剛好跟得上那條線移動的速度。

「追上了沒」這個問法,預設終點是固定的。實際上終點會自己跑。

抄捷徑這條路被強化學習封掉了

Lambert 提出一個很具體的機制,解釋過去這幾年開源為什麼能一直把差距壓在幾個月內:

A large portion of the perpetual catch-up is likely due to the best open model builders constantly distilling their models on the strongest, currently available closed API models, but this direction seems less relevant with the rise of RL.

蒸餾(拿強模型的輸出當教材,訓練自己的模型去模仿)一直是開源追趕的主要捷徑:閉源把 API(讓別的程式直接接進去用的管道)開出來,等於同時附上一份現成的教材。

但訓練的重心從「模仿別人的輸出」轉到 RL(強化學習,讓模型自己試,再依結果好壞調整)之後,這條捷徑就沒那麼好用了。RL 的成果長在自己的訓練環境和獎勵設計裡,不是抄輸出就抄得到的。

半年後他把同一件事講得更白。八月十四號那篇寫 GLM-5.3:

One does not simply "distill" RL environments, infrastructure to run them at scale, or algorithms to mix them together effectively.

RL 環境、讓這些環境大規模跑起來所需要的基礎設施、還有把它們有效組合起來的演算法——這些東西沒辦法「蒸餾」。

回到二月那篇,Lambert 的結論是:開源要贏,只剩下自己做出根本性的創新這一條路。

這跟我昨天寫的簡立峰那段是同一件事的兩面。簡立峰講的是中國的算力被出口管制卡死,結果是被逼著把訓練效率往上推。捷徑被封掉,剩下的只有自己想辦法——那正是 Lambert 說開源唯一能贏的那條路。

公開評測本身就會低估差距

這是原文裡我昨天完全漏掉的一段,而且它剛好打臉了我昨天的做法。Lambert 寫:

The frontier of AI has never been harder to capture in public benchmarks.

他的理由是:美國那幾家前沿實驗室,對「哪些能力才是真正重要的」看得比較準,而公開評測相對容易被過度擬合(模型針對已知的考題調整,考卷分數上去,真實能力沒跟著上去)。他還點名了當時 Qwen 的旗艦 v3.5,被很多人抱怨在 benchmaxing——衝榜分數。

他那篇的原始判斷是:與其相信「開源史上最接近閉源」,他更願意賭是 Artificial Analysis Intelligence Index 這項指標本身沒有代表到真正的前沿。

半年後,他已經把月數從 6 到 9 個月改成 3 到 5 個月了,但這個判斷還是沒變。八月十四號那篇他寫:

It is very, very likely that OpenAI and Anthropic have far better internal models than Z.ai and Moonshot AI. Still, these American companies tend to take months to release their models to the public, which massively flatters the Chinese labs in adoption decisions at the frontier.

OpenAI 和 Anthropic 內部很可能有遠比外面看到的更強的模型,只是要好幾個月才會放出來。你在榜上看到的差距,是被這個時間差美化過的。

換句話說,公開分數會往「差距變小」的方向偏。而我昨天那個反駁,用的剛好就是他這句話點名過的那種數字。

那昨天那張榜要怎麼看

今天再開一次 arena.ai 的 WebDev 排行榜,前五名的名字和分數跟昨天完全一樣:1691、1674、1669、1663、1629。所以昨天看到的不是隨手抓到的一個瞬間。

但有一欄我昨天沒有看仔細——授權。

前三名裡,第 2 名 Kimi K3 掛的是自己寫的 Kimi K3 License,第 3 名 qwen3.8-max 在榜上那一欄直接標成 Proprietary——都不是 MIT、Apache 這種「拿去隨便用」的標準開源授權。照排行榜上那一欄看下去,第一個掛 MIT 的是第 8 名的 glm-5.3-max,1599 分,跟第一名差 92 分。

看到這裡我才發現,昨天我還寫錯了一件更基本的事。我昨天寫「第二名和第三名,權重都是可以下載的」——第三名那個是錯的。

第 2 名 Kimi K3 的權重確實拿得到,放在 Hugging Face 上,96 個權重分片加上程式碼和授權文件,任何人都下載得到。但第 3 名的 qwen3.8-max 沒有。它是只走 API 的線上模型,支援多模態、一百萬 token 的上下文,權重從來沒有放出來。榜上那一欄標 Proprietary,標得沒錯,是我昨天沒看。

會搞混是因為 Qwen 八月十二號真的放了一包 Max 級別的權重出來——但那是另一個模型:Qwen3.8-2.4T-A95B,純文字、不吃圖。用寫那篇的人的話說,那是「a preview, not the product」,預覽版,不是榜上那一個。名字像,東西不一樣。

所以「開放權重排進前三」這句話,答案取決於你把哪一條線當成開源:

  • 權重真的拿得到就算 → 前三名裡只有一個,就是第 2 名的 Kimi K3
  • 要標準開源授權(MIT、Apache)才算 → 開源的第一名掉到第 8,差 92 分
  • 再疊上 Lambert 那句「公開評測抓不到前沿」→ 這張榜給的也只是一個下限

三條線會給你三個不同的答案。而我昨天不只挑了最寬鬆的那一條,還把那一條講錯了。

這件事本身就是這篇的註腳:連「哪些排在前面的模型算開源」這種看一眼就能查的事,我都會抄快一步抄錯。那些查不了的——內部有多強、還沒放出來的有什麼——就更不用說了。

下載得到,不等於用得起來

上面講的全部都是「模型有多強」。但我自己實際用開源模型的經驗是,強不強只佔一半。

比較常擋住我的不是模型笨,是一堆細節要調整。跑起來之後常常收到模型回傳的錯誤訊息,整個流程就卡在那裡。這些問題大部分應該都有解,但要解它,你得知道該改哪個設定,或是自己一步步找出問題出在哪才修得掉——這得有一定的技術底子撐著。

而維護本身,就是一項常被忽略的成本。

請專業的人代勞是一條實際的路。只要不是自己從頭到尾處理,最後就會繞回信任問題:你還是在信一個自己看不到裡面的東西。到那一步,它跟閉源模型的差別已經沒有多大了。

所以我猜比較可能發生的情況是這樣:有足夠資金、時間、人才的大公司,會拿開源模型在內部養出一套只有自己用的封閉模型,補上原本「開源」的那個位置。個人做得到,只是放眼整個市場,這樣的例子還很少。

追上了,追上的是幾個月前的那一版。而能不能真的用它,榜上那個分數完全沒算到。

最近開始做免費的一對一諮詢,幫你把 AI 接進自己的工作流程——有需要的話可以約:https://www.dawsonwang.com/


來源:

延伸閱讀
看完整 242 篇 →