一個小工具,解決一件煩人的雜事
關於我做了一個免費的 LRC 字幕產生器——因為 API 已經便宜到,這個問題再不解掉實在有點難為情。
有一種工作我看朋友做了好幾年,一直覺得是「人不該做」的事:對著一個 MP3 檔案,聽兩秒、按暫停、在文字檔輸入一個時間戳、再繼續聽。卡拉 OK 字幕製作者在做,做 TikTok 對唇影片的人在做,製作語言學習教材的人也在做。一首三分半的歌,手工對軸大約要花三十分鐘。這件事 2018 年沒辦法自動化,2026 年卻幾乎能零成本解決——但中間這道鴻溝,很多人還沒意識到。
問題的本質是:當音訊本身就「說」出了那些文字、機器又聽得懂,人類就不該再繼續手動把兩邊對起來。會拖到今天還沒被解掉,只是因為過去自動辨識不夠準、字級時間戳不夠細,能用的工具又卡在每月 30 美元的訂閱牆後面。
OpenAI 的 Whisper(原版 2022 年釋出)是第一個我覺得「夠用」的版本。它現在的價格是每分鐘 $0.006 美金,一首三分半的流行歌,轉錄成本大約 NT$0.7。這筆帳終於翻過去了:一個能把三十分鐘的無聊工作壓成二十秒、成本不到一則簡訊的工具,是該存在的工具。
所以我做了。它放在 PromptCraft 子網的 /lrc-sync-generator。流程是:上傳 MP3、貼上你已經有的歌詞、按一下產生,幾秒後就拿到帶時間戳的 LRC 檔。難的不是轉錄,是對齊——Whisper 聽到的字,跟你貼上的歌詞不一定一致,所以我寫了一段小演算法:抓每行歌詞的前 4 個字,在 Whisper 的字流裡 linear scan 找位置,取那個 timestamp。找不到 4 個字就 fallback 找 2 個字,再找不到,就讓那一行沒有 timestamp,交給人自己補。中文流行歌跟西洋歌,平均第一次跑都能對到 90% 以上。
同一個工具還有另外三個模式,因為音訊基建蓋好之後,再加它們的邊際成本是零:手動模式(用空白鍵自己敲時間,AI 對錯的時候用)、LRC ↔ SRT 雙向格式轉換(卡拉 OK 用 LRC、影片字幕用 SRT,中文還分直書橫書,市面上沒有一個乾淨的純前端工具兩種都做)、反向萃取(把 LRC / SRT 字幕的時間戳去掉、拿回純文字)。後面這三個模式完全沒有打 API,純粹在瀏覽器裡跑 JavaScript,免費、不需登入。
AI 模式限會員使用,單次扣 5 點——因為 Whisper 的帳單是真的,我不希望它沒有上限地漲下去。新用戶註冊送 30 點,夠你跑 6 首歌,應該足以讓你判斷這工具對你有沒有用。如果你發現自己常用,stock.luvai.net 那邊的點數加購包在這裡也通——同一個帳號、同一個錢包,跨子網是設計好的。
這個工具其實沒什麼了不起,就是套在一個現成 API 上、薄薄一層演算法。但我想記下來的、我覺得真正值得記的,是做這個工具的「決定」本身,是基於一個我最近愈來愈常做的計算:這件事以前很難,現在不難了,而「還很難」跟「變得超簡單」之間那道鴻溝,填滿了還在被真人手動處理的雜事,只因為沒人抽空去把那個顯而易見的版本寫出來。我覺得現在 indie AI 工具最有用的工作,大部分都坐在這個區段裡。不是登月計畫,是那些終於變得可以自動化的、無聊的家事。
另外想說的是:這工具底下坐著的基建——點數系統、登入、跨子網錢包——那才是真正的工作。Whisper 串接只花了幾個小時;讓一個全新的子網接進 LuvAI 既有的用戶系統、對既有的點數桶扣費、跟既有的 admin 工具保持同步:那是好幾個月的事。這是業外人看 indie software 常常漏掉的一點:看得見的功能只是冰山一角,底下不太看得見的水管管線,才是花大錢的地方。每多一個工具都很便宜,是因為那次昂貴的管線,早就付過了。
如果你硬碟裡有歌詞跟音訊各自躺著、一直懶得對軸,試試看吧。已經有 LuvAI 帳號的話免費,還沒有的話,註冊送的點數夠你對 6 首。如果你用產出的檔案做了什麼好玩的東西,寄信給我聽聽。我很愛聽別人怎麼用這些工具——這是我判斷下一個該做什麼的方式。