錄音的終點應該是知識庫




今年開始我積極參加實體聚會、做陌生開發。很多時候重點跟需求都藏在對話裡,或是客戶突然打電話過來交代一些事情——這些當下都不方便拿筆記下來。
我的想法很簡單:只要有錄音,剩下的事情 AI 就能完成 90%。
但市面上的錄音設備跟軟體,主打的都停在會議記錄、摘要、心智圖,我還沒看到有人做到最後一步。我覺得終點應該是企業的知識庫才對。
這篇分享:我現在怎麼處理錄音、為什麼買了 HiDock P1 還是不滿意,以及我心中理想的流程長什麼樣子。
現在的流程:錄完音,還要記得搬
不管是用筆電還是手機錄音,錄完之後我都得記得做這幾件事:
- 把錄音檔搬到筆電(用手機錄的話)
- 跑本機的 Whisper(OpenAI 開源的語音辨識模型)轉成文字
- 把逐字稿放進指定的專案資料夾
- 再餵給 agent 去整理、做事
每一步都不難,但每一步都要我「記得」。忘了搬,那段對話就躺在手機裡;搬了沒轉,就只是一個音檔。
Day 269 我測了六個本機語音辨識模型,就是因為這條流程裡,轉文字這一步我每天都在用。
買了 HiDock P1,因為它能接 AirPods
我最近買了 HiDock P1。選它的原因是藍牙耳機可以透過它來錄音,所以我可以沿用平常習慣的 AirPods,講電話、開會都能錄到雙方的聲音。
但整個體驗其實還是有落差:
- 錄完之後,我要主動把錄音從設備轉移到筆電的網頁上,再點一下轉逐字稿
- 它的逐字稿,有時候甚至不如我本機跑的模型
- 整個流程一點都不聰明,每一步都還是要人去推
說穿了,它幫我解決的是「錄」這一步,後面的「搬、轉、整理、歸檔」還是我自己來。
我想像的流程長這樣
- 錄完音,檔案自動傳到筆電
- 傳到的那一刻,agent 自動偵測到新檔案,開始轉文字
- 轉完直接整理成方便閱讀的格式,例如一頁 HTML
- 10 分鐘後,我可以把剛剛的會議內容分享給客戶,請對方確認規格
- 同一份內容同步匯入我的知識庫
從錄音按下停止到拿到可以給客戶確認的稿子,中間我一個按鈕都不用按。
理想的工具要做到這五件事
- 不改變使用習慣,隨時收音:這點最難,因為手機上的錄音支援還不齊全
- 自動轉逐字稿
- 自動整理成好讀的格式:例如 HTML,可以直接傳給客戶看
- 資訊不外洩:最好不透過雲端,整條流程留在本機(目前主流的錄音筆,包括 HiDock,轉逐字稿都還是走雲端)
- 續航力要夠:跑一整天的聚會跟電話不能沒電
卡住的是跟 agent 的結合
錄音、轉文字、摘要,每一段都已經有工具了。缺的是把它們接起來的那一段:錄音檔一出現就自動觸發轉錄、轉完自動交給 agent、agent 再依照我的 skill 整理成我要的格式,最後放進知識庫。
我想問的是:目前的服務是不是都很難跟 skill 之類的串起來?還是其實已經有人做好了,只是我還沒找到?
如果有一個工具能從錄音一路自動走到知識庫,你會想用嗎?
Day 269 本地語音轉文字模型比較:https://www.dawsonwang.com/day/269 HiDock P1:https://www.hidock.com/products/hidock-p1-ai-voice-recorder