AI深度產業頭條

GPT Transcribe 與 GPT Live Transcribe 差在哪?

琥珀色聲音波形分成完整錄音與即時字幕兩條藍色文字路徑
跳到答案

GPT TRANSCRIBE vs. GPT LIVE TRANSCRIBE

錄音轉文字,
該選哪個模型?

選擇前先看音訊的狀態:已經錄完,還是仍在即時輸入? 文字要即時出現,還是等音訊結束後再產生?

錄音已完成:選 GPT Transcribe 需要即時字幕:選 GPT Live Transcribe
完成後定稿 收音時即時出字
01 / WHEN

音訊已錄完,
還是仍在收音?

錄音檔已經完成時,模型可以處理整段音訊。麥克風、電話或直播仍在收音時, 系統會先回傳片段文字,等這一段音訊結束後再回傳完整結果。

GPT TRANSCRIBE 完整錄音/已提交回合
處理完整音訊後回傳文字
GPT LIVE TRANSCRIBE 麥克風/通話/直播
邊收音,邊回傳文字
02 / WORKFLOW

串流的是結果,
還是音訊?

GPT Transcribe 處理的是已完成的音檔;即使結果可以陸續回傳,輸入音訊仍然是完整的。 GPT Live Transcribe 則透過 WebSocket 或 WebRTC,持續接收麥克風、通話或直播的聲音。

選一個符合你的使用情境,下方會顯示建議模型、價格與輸出方式。

GPT Transcribe US$0.0045/分鐘

適合會議錄音、訪談檔、客服錄音與課程影片。音檔處理完成,或 Realtime 音訊回合提交後,系統會回傳完整文字。

已完成的音檔 可陸續回傳結果 完整轉錄文字
03 / COST

即時轉錄,
單價約高 3.78 倍

官方目前列出的每分鐘價格:GPT Transcribe 是 0.0045 美元, GPT Live Transcribe 是 0.017 美元。

1,200 每月轉錄分鐘數
GPT Transcribe
US$5.40
GPT Live Transcribe
US$20.40

以 60 分鐘計算,兩者約為 0.27 與 1.02 美元。這裡只算模型轉錄費, 不含音訊儲存、網路、前後端服務、人工校對與其他系統成本。官方也沒有承諾固定的毫秒級延遲。

同一段
台灣中英夾雜語音
自由文字脈絡 關鍵詞 多個預期語言 提示不是保證
04 / CONTEXT

提示專有名詞,仍要抽樣驗證

兩個模型都支援自由文字脈絡、關鍵詞與多個預期語言。公司名、產品名、縮寫, 以及台灣常見的中英夾雜語音,都可以先提供相關提示。

OpenAI 把關鍵詞定義為提示,不是強制輸出。它可能提高專有名詞辨識,也可能讓沒被說出的詞跑進結果。 上線前,應使用自己的音檔、口音與噪音條件抽樣測試。

官方文件沒有提供兩個模型在繁體中文或台灣口音上的獨立準確率比較; 因此,不能根據「高準確」的產品定位,判定哪個模型在繁體中文或台灣口音上較準。
05 / LIMITS

這四項需求,
要另外處理

以下四項需求,官方文件目前指向其他模型、輸出格式或檔案處理方式。

逐字或逐段時間戳

官方檔案轉錄指南目前指向 whisper-1timestamp_granularities[]。如果要剪字幕或對齊影片,應確認輸出包含需要的時間戳。

分辨誰在說話

講者標記要改用 gpt-4o-transcribe-diarize, 它能回傳包含 speaker、start、end 的分段結果。

把語音翻成英文

英語翻譯要使用專用的翻譯流程,不能直接把一般轉錄輸出當成翻譯結果。

處理超過 25MB 的音檔

GPT Transcribe 的一般檔案上限為 25MB; 超過上限的錄音要先切分,或調整音訊壓縮方式。

06 / DECISION

文字何時要出現?

可以等錄音結束

適合會議錄音、訪談、客服錄音,以及已提交的 Realtime 音訊回合。

GPT Transcribe
US$0.0045/分鐘
轉錄文字
何時要出現?

現在就要看到字

適合麥克風、電話、直播、即時字幕,以及持續輸入的音訊。

GPT Live Transcribe
US$0.017/分鐘

兩個模型的價差,
主要來自文字是否需要即時出現。

Written by
黃郁棋

《科技人》站長,在科技業打滾十年的老屁股,每天都覺得自己要被新技術取代了,完了完了。

打賞科技人|祝您有個美好的一天

科技人原創 BGM

音樂目錄載入中

預設暫停,等你按下播放

0:00 0:00