7月29日,OpenAI发布了两款新转录模型:GPT-Transcribe和GPT-Live-Transcribe。前者适合把录好的音频批量转成文字,每分钟只要0.0045美元,约合人民币3分钱;后者适合实时字幕和在线会议,每分钟约0.12元。
这篇文章带你从零开始,用Python把一段录音转成文字,再扩展到3个实用场景。
一、准备工作:申请OpenAI API Key
- 打开 platform.openai.com,登录你的OpenAI账号。
- 点击右上角个人头像 → API keys → Create new secret key。
- 给Key起个名字(如“transcribe-demo”),复制生成的字符串,只显示一次,务必保存好。
- 新账号通常有5美元试用额度,足够测试。
注意:国内网络访问OpenAI API可能需要特殊环境,请自行准备。
二、安装Python环境
确保电脑已安装Python 3.11或更高版本,然后打开终端执行:
pip install --upgrade openai
安装完成后,新建一个文件夹,里面放你的音频文件,比如 meeting.wav。
三、最简示例:把录音转成文字
在同文件夹下新建 transcribe.py,写入以下代码:
import os
from openai import OpenAI
# 把这里换成你的API Key
client = OpenAI(api_key="sk-xxxxxxxxxxxxxxxxxxxxxxxx")
audio_file = open("meeting.wav", "rb")
transcript = client.audio.transcriptions.create(
model="gpt-transcribe",
file=audio_file,
response_format="json",
prompt="这是一段中文会议录音,讨论的是产品上线计划。",
extra_body={
"keywords": ["上线", "排期", "负责人"],
"languages": ["zh"]
}
)
print(transcript.text)
保存后运行:
python transcribe.py
几秒后,你就会看到转录出的文字。
四、实时转录:边说边出字
如果你要做直播字幕或在线会议实时字幕,需要用 GPT-Live-Transcribe,通过OpenAI的Realtime API连接WebSocket。
这里给一个简化的Python示例(需要 websockets 库):
import asyncio
import websockets
import json
import base64
async def live_transcribe():
url = "wss://api.openai.com/v1/realtime?intent=transcription"
headers = {
"Authorization": "Bearer sk-xxxxxxxxxxxxxxxxxxxxxxxx",
"OpenAI-Beta": "realtime=v1"
}
async with websockets.connect(url, extra_headers=headers) as ws:
# 配置转录会话
await ws.send(json.dumps({
"type": "transcription_session.update",
"session": {
"input_audio_transcription": {"model": "gpt-live-transcribe"},
"turn_detection": {"type": "server_vad"}
}
}))
# 这里循环读取麦克风音频并发送(伪代码)
# audio_chunk = get_microphone_audio()
# await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": base64_audio}))
async for message in ws:
event = json.loads(message)
if event["type"] == "conversation.item.input_audio_transcription.completed":
print("实时转录:", event["transcript"])
asyncio.run(live_transcribe())
完整实时音频采集需要配合PyAudio等库,这里展示的是核心逻辑。
五、3个实用场景
场景1:自动整理会议纪要
把会议录音转成文字后,再用AI提炼要点。提示词:
请根据以下会议录音文字,整理出:1. 讨论了哪几个议题;2. 每个议题的结论;3. 下一步行动项及负责人;4. 截止时间。
场景2:播客/视频字幕
自媒体人可以把视频或播客的音轨导出为MP3/WAV,用GPT-Transcribe批量生成字幕稿,再导入剪映等剪辑软件自动生成字幕。
场景3:采访录音整理
记者、写作者可以把采访录音转成文字,再用提示词区分发言人:
以下是一段采访录音文字,请按“记者:”和“受访者:”的格式整理成对话体,并标出每个人的关键观点。
六、提升准确率的3个技巧
- 用prompt描述场景:告诉模型“这是一段客服电话”或“这是医学讲座”,准确率会明显提升。
- 用keywords标注专有名词:人名、产品名、药品名等容易听错的词,提前写进keywords。
- 用languages指定语言:如果录音里有中英文混说,写成
["zh", "en"]。
七、费用参考
| 模型 | 价格 | 1小时录音成本 | 适合场景 |
|---|---|---|---|
| GPT-Transcribe | 0.0045美元/分钟 | 约1.8元 | 批量录音、会议回听 |
| GPT-Live-Transcribe | 0.017美元/分钟 | 约7.3元 | 直播字幕、实时会议 |
| Whisper | 旧模型,逐渐被替代 | – | 已有项目迁移中 |
八、国内替代方案
如果你暂时无法使用OpenAI API,这些国内工具也能实现类似效果:
- 通义听悟:阿里云出品,支持会议记录、音视频转写,每天有免费额度。
- 讯飞听见:科大讯飞产品,中文识别准确率高,适合采访和会议。
- 飞书妙记:上传音视频自动生成文字稿和会议纪要,免费好用。
以上就是OpenAI新转录模型的完整上手教程。只要有API Key和一段录音,5分钟就能跑通。如果你用上了,欢迎回来分享效果。