GPT TRANSCRIBE vs. GPT LIVE TRANSCRIBE
錄音轉文字,
該選哪個模型?
選擇前先看音訊的狀態:已經錄完,還是仍在即時輸入? 文字要即時出現,還是等音訊結束後再產生?
音訊已錄完,
還是仍在收音?
錄音檔已經完成時,模型可以處理整段音訊。麥克風、電話或直播仍在收音時, 系統會先回傳片段文字,等這一段音訊結束後再回傳完整結果。
串流的是結果,
還是音訊?
GPT Transcribe 處理的是已完成的音檔;即使結果可以陸續回傳,輸入音訊仍然是完整的。 GPT Live Transcribe 則透過 WebSocket 或 WebRTC,持續接收麥克風、通話或直播的聲音。
選一個符合你的使用情境,下方會顯示建議模型、價格與輸出方式。
適合會議錄音、訪談檔、客服錄音與課程影片。音檔處理完成,或 Realtime 音訊回合提交後,系統會回傳完整文字。
即時轉錄,
單價約高 3.78 倍
官方目前列出的每分鐘價格:GPT Transcribe 是 0.0045 美元, GPT Live Transcribe 是 0.017 美元。
以 60 分鐘計算,兩者約為 0.27 與 1.02 美元。這裡只算模型轉錄費, 不含音訊儲存、網路、前後端服務、人工校對與其他系統成本。官方也沒有承諾固定的毫秒級延遲。
台灣中英夾雜語音
提示專有名詞,仍要抽樣驗證
兩個模型都支援自由文字脈絡、關鍵詞與多個預期語言。公司名、產品名、縮寫, 以及台灣常見的中英夾雜語音,都可以先提供相關提示。
OpenAI 把關鍵詞定義為提示,不是強制輸出。它可能提高專有名詞辨識,也可能讓沒被說出的詞跑進結果。 上線前,應使用自己的音檔、口音與噪音條件抽樣測試。
這四項需求,
要另外處理
以下四項需求,官方文件目前指向其他模型、輸出格式或檔案處理方式。
逐字或逐段時間戳
官方檔案轉錄指南目前指向 whisper-1 的
timestamp_granularities[]。如果要剪字幕或對齊影片,應確認輸出包含需要的時間戳。
分辨誰在說話
講者標記要改用 gpt-4o-transcribe-diarize, 它能回傳包含 speaker、start、end 的分段結果。
把語音翻成英文
英語翻譯要使用專用的翻譯流程,不能直接把一般轉錄輸出當成翻譯結果。
處理超過 25MB 的音檔
GPT Transcribe 的一般檔案上限為 25MB; 超過上限的錄音要先切分,或調整音訊壓縮方式。
文字何時要出現?
可以等錄音結束
適合會議錄音、訪談、客服錄音,以及已提交的 Realtime 音訊回合。
US$0.0045/分鐘
何時要出現?
現在就要看到字
適合麥克風、電話、直播、即時字幕,以及持續輸入的音訊。
US$0.017/分鐘
兩個模型的價差,
主要來自文字是否需要即時出現。