DAY 204

讓 AI 自己驗自己

SLIDES · 6
Day 204 讓 AI 自己驗自己 — 投影片 1Day 204 讓 AI 自己驗自己 — 投影片 2Day 204 讓 AI 自己驗自己 — 投影片 3Day 204 讓 AI 自己驗自己 — 投影片 4Day 204 讓 AI 自己驗自己 — 投影片 5Day 204 讓 AI 自己驗自己 — 投影片 6
1 / 6

這次改一份商業登記申請書的 PDF——在表格裡加幾個營業項目代碼——我一行程式碼都沒寫,從頭到尾只出一張嘴。全程指揮 AI 做,聽起來很輕鬆,但中間卡了很久,卡點不是它不會做,是它「以為自己做完了」。

先講一下這次的特別之處:PDF 不是純文字、不像程式碼那樣一行一行,沒辦法讓 AI 直接讀檔、改幾行就算數。所以我跟它溝通的方式很原始——把要改的區域直接截圖,再附上 PDF 的檔案路徑丟給它,讓它照著改。整個互動從頭到尾都是「看圖、對圖」,也因為這樣,對得準不準,一開始只能靠我的肉眼。

這篇想講的其實跟 PDF 沒什麼關係:AI 很會產生幻覺、還會自己宣稱達成目標,但打開一看根本不是那回事。而我後來發現,解法不是換更強的模型——是把「驗收」這一步也交給它自己,讓 AI 自己驗自己。

AI 很敢說「好了」,但常常不是那回事

第一次它就回我「改好了,存在修改版」。我打開一看:字是疊在一起的,位置也歪掉。它不是騙我,是它真的以為自己做好了——它沒辦法回頭看自己的成品,所以「完成」對它來說只是「我輸出了東西」,不是「這東西是對的」。

這就是幻覺最麻煩的地方:它不只把不存在的東西講得很篤定,還會把「我沒做好的事」當成「我做好了」回報給你。

換更強的模型,只是換一種歪法

我一開始的直覺跟大家一樣:這版不行,換更強的、再試一次。於是我截圖回報「這裡疊字」「那裡歪了」,它調座標、換字型、改字級……每次都只修好一部分,又生出新的毛病。反覆用更強的模型、更兇的指令試了很多輪,還是不理想。

問題根本不在模型夠不夠強。它每次都在猜、每次都跟我說「這次好了」,而唯一能判斷「到底好了沒」的人,是我。

真正的瓶頸是「我」

我才意識到卡點在哪:每次它改完,都要我手動點開 PDF、用肉眼一格一格看哪裡還歪。它改一輪、我看一輪,來回好幾趟。這個流程裡最慢、最累的一環,就是那個「人肉驗收員」——我。

只要驗收這一步還掛在我身上,這件事就永遠自動不起來。我等於是它的眼睛,它每做一步都要停下來等我點頭。

把驗收也交給 AI

所以我換了思路:與其一直當它的人肉驗收員,不如把整個流程自動化——連「驗收」這一步都交給 AI 自己。

具體就是加一個驗證者(verifier)的角色:讓它自己把原始 PDF 跟改完的版本擺在一起比對,自己判「過」還是「不過」,不過就自己再修。我不再是迴圈裡的那雙眼睛,只負責一開始講清楚「什麼叫做對」。

加進這個自我驗收的步驟之後,它自己跑、自己抓到先前一直沒發現的真正問題、自己修好,一輪就收斂了。同一個模型、同一件事,差別只在——這次它有辦法評價自己。

而且這次要驗的其實有兩件事,很容易只顧到一件:一是「改完的版面、字型跟原檔像不像」,二是「這些營業代碼本身填得對不對、適不適用」。兩個是不同層次的檢查,但道理一樣——都該各自拆成一個明確的驗證任務、清楚指派給 AI 去跑,而不是只自動化了第一件,第二件又默默留給自己用肉眼盯。你要做的,就是把「總共有哪幾件要驗、每一件怎樣算過」講清楚,一個一個交出去。

為什麼這件事值得記下來

因為「讓 AI 自己評自己」可以省掉大量人類跟它反覆來回的時間。我們很習慣把 AI 當成一個要人盯著改的實習生——它做、你看、你退回、它再做。但只要你能把「怎樣算對」寫成它自己跑得動的檢查,它就能自己做、自己看、自己退回、自己再做,你只要看最後結果。

往上拉一層看,這其實就是把「做→驗→修→再驗」這個迴圈設計到能自己跑、自己收斂——工程界叫它 loop engineering。現在大家都在追 graph engineering(把一堆 agent 用一張圖編排成複雜流程),但我覺得順序不能反:連一個最基本的 do-check-fix 迴圈都收不了,上面疊再漂亮的 graph 也是空的。loop 沒練好,後面的都免談。

一句話:AI 最缺的不是更強的腦,是一面能讓它看見自己的鏡子——你把鏡子給它,它就不用一直等你點頭。

最近開始做免費的一對一諮詢,幫你把 AI 接進自己的工作流——有需要的話可以約:https://www.dawsonwang.com/


素材來源:本機用 Claude Code 改一份台灣商業登記申請書 PDF 的 session(2026-07),全程沒有手寫程式碼。

延伸閱讀
看完整 204 篇 →