DAY 231 · 2026-08-18

其實用 OpenCC 就好了

SLIDES · 6
Day 231 其實用 OpenCC 就好了 — 投影片 1Day 231 其實用 OpenCC 就好了 — 投影片 2Day 231 其實用 OpenCC 就好了 — 投影片 3Day 231 其實用 OpenCC 就好了 — 投影片 4Day 231 其實用 OpenCC 就好了 — 投影片 5Day 231 其實用 OpenCC 就好了 — 投影片 6
1 / 6

今年為了發文這件事搞了一個支語警察 skill,在校稿環節會去掃文章有沒有殘留的簡體用詞。你會看到一個對照表,比方說 質量→品質、信息→資訊、接口→介面,這樣一條一條列。大概列了四十幾條,都是從實際發文撞到的錯誤累積下來的。

然後前陣子有一次在處理翻譯逐字稿的任務時,偶然發現別人的流程裡就用了 OpenCC,已經把這個轉換做掉了。一查才知道有這個工具,而且它做的遠不止我那四十幾條。這篇分享的是:OpenCC 是什麼、我怎麼接進工作流程、以及這件事讓我發現什麼。

OpenCC 是什麼、怎麼接

OpenCC(開放中文轉換)是一套成熟的簡繁轉換工具,GitHub 上開源很久了:https://github.com/byvoid/opencc

它不只做字對字轉換,還內建了幾組用語轉換(台灣慣用、香港慣用)。遇到一個簡體字對應好幾個繁體寫法的時候,它是靠分詞加詞組詞典判斷(長詞優先),不是靠一張死的對照表硬對。

接法很簡單:

  1. AI 輸出簡體逐字稿
  2. opencc -i input.txt -o output.txt -c s2twp.json
  3. 人工確認

s2twp.json 是 OpenCC 內建的「簡體→台灣正體+台灣用詞」設定檔;只想換字不換用詞的話用 s2tw.json。內建的設定檔還有 s2hkp.json(香港用詞)、s2hk.json(只轉香港字形)、s2t.json(純簡轉繁)等。一行指令,不用自己維護對照表。

那我以前那四十幾條對照表呢?

發現 OpenCC 之前,我那條簡繁轉換流程長這樣:

  1. AI 輸出簡體逐字稿
  2. 自己的對照表逐條取代
  3. 人工確認

最大的麻煩不是一開始建那四十幾條,而是後續。你永遠不知道漏了什麼。只靠樣本補規則,沒撞到的一對多,就是你文章裡的錯字。而且跨專案要複製同樣的規則也很麻煩,換一個專案就要再搬一次那份對照表,或做一個捷徑連過去。

轉換品質比我那份四十幾條的對照表好多了——不是因為 OpenCC 比較聰明,是因為它的詞典跟規則是社群從 2010 年維護到現在、十六年的累積,一對多這種情況的覆蓋率遠超過我一個人靠樣本補出來的清單。

有沒有轉錯的時候

有,OpenCC 還是會轉錯。但差別在於:OpenCC 的錯誤是已知的、可預期的(某個詞沒進詞組表,或詞典裡就固定對到某一邊)。自己維護對照表的錯誤是未知的、隨機的(某個冷門詞沒列到,你根本不知道它沒轉)。

所以現在我的做法是:先用 OpenCC 做基礎轉換,然後針對特定領域補幾條後處理規則(例如 質量→品質 這種 OpenCC 詞典沒收的,還是得自己補)。這個負擔比以前自己養整份對照表小很多——從「維護四十幾條對照規則」變成「維護五到十條例外」。

這件事讓我想比較多的是

不是「先找工具再做」,而是:

你根本不知道你不知道什麼。

我那時候不是預設 OpenCC 不夠好,而是根本不知道有這個工具。如果只是沿用之前的成功經驗——嗯,對照表加一條規則就好了、再加一條就好了——那我永遠不會發現 OpenCC。

這就是為什麼現在有一派人說不要過度依賴 skill / 既有流程。不是 skill 不好,而是如果每次遇到問題都在現有的工具組合裡找解法,你會不知不覺把更好的解法擋在門外。而你永遠不知道這次的解法是不是最好的。

最近開始做免費的一對一諮詢,幫你把 AI 接進自己的工作流——有需要的話可以約:https://www.dawsonwang.com/

延伸閱讀
看完整 242 篇 →