工具教程

OpenAI新转录模型使用指南:3分钱/分钟把语音转成文字,5分钟上手(附代码)

AI执行官

7月29日,OpenAI发布了两款新转录模型:GPT-TranscribeGPT-Live-Transcribe。前者适合把录好的音频批量转成文字,每分钟只要0.0045美元,约合人民币3分钱;后者适合实时字幕和在线会议,每分钟约0.12元。

这篇文章带你从零开始,用Python把一段录音转成文字,再扩展到3个实用场景。

一、准备工作:申请OpenAI API Key

  1. 打开 platform.openai.com,登录你的OpenAI账号。
  2. 点击右上角个人头像 → API keysCreate new secret key
  3. 给Key起个名字(如“transcribe-demo”),复制生成的字符串,只显示一次,务必保存好。
  4. 新账号通常有5美元试用额度,足够测试。

注意:国内网络访问OpenAI API可能需要特殊环境,请自行准备。

二、安装Python环境

确保电脑已安装Python 3.11或更高版本,然后打开终端执行:

pip install --upgrade openai

安装完成后,新建一个文件夹,里面放你的音频文件,比如 meeting.wav

三、最简示例:把录音转成文字

在同文件夹下新建 transcribe.py,写入以下代码:

import os
from openai import OpenAI

# 把这里换成你的API Key
client = OpenAI(api_key="sk-xxxxxxxxxxxxxxxxxxxxxxxx")

audio_file = open("meeting.wav", "rb")

transcript = client.audio.transcriptions.create(
    model="gpt-transcribe",
    file=audio_file,
    response_format="json",
    prompt="这是一段中文会议录音,讨论的是产品上线计划。",
    extra_body={
        "keywords": ["上线", "排期", "负责人"],
        "languages": ["zh"]
    }
)

print(transcript.text)

保存后运行:

python transcribe.py

几秒后,你就会看到转录出的文字。

四、实时转录:边说边出字

如果你要做直播字幕或在线会议实时字幕,需要用 GPT-Live-Transcribe,通过OpenAI的Realtime API连接WebSocket。

这里给一个简化的Python示例(需要 websockets 库):

import asyncio
import websockets
import json
import base64

async def live_transcribe():
    url = "wss://api.openai.com/v1/realtime?intent=transcription"
    headers = {
        "Authorization": "Bearer sk-xxxxxxxxxxxxxxxxxxxxxxxx",
        "OpenAI-Beta": "realtime=v1"
    }

    async with websockets.connect(url, extra_headers=headers) as ws:
        # 配置转录会话
        await ws.send(json.dumps({
            "type": "transcription_session.update",
            "session": {
                "input_audio_transcription": {"model": "gpt-live-transcribe"},
                "turn_detection": {"type": "server_vad"}
            }
        }))

        # 这里循环读取麦克风音频并发送(伪代码)
        # audio_chunk = get_microphone_audio()
        # await ws.send(json.dumps({"type": "input_audio_buffer.append", "audio": base64_audio}))

        async for message in ws:
            event = json.loads(message)
            if event["type"] == "conversation.item.input_audio_transcription.completed":
                print("实时转录:", event["transcript"])

asyncio.run(live_transcribe())

完整实时音频采集需要配合PyAudio等库,这里展示的是核心逻辑。

五、3个实用场景

场景1:自动整理会议纪要

把会议录音转成文字后,再用AI提炼要点。提示词:

请根据以下会议录音文字,整理出:1. 讨论了哪几个议题;2. 每个议题的结论;3. 下一步行动项及负责人;4. 截止时间。

场景2:播客/视频字幕

自媒体人可以把视频或播客的音轨导出为MP3/WAV,用GPT-Transcribe批量生成字幕稿,再导入剪映等剪辑软件自动生成字幕。

场景3:采访录音整理

记者、写作者可以把采访录音转成文字,再用提示词区分发言人:

以下是一段采访录音文字,请按“记者:”和“受访者:”的格式整理成对话体,并标出每个人的关键观点。

六、提升准确率的3个技巧

  1. 用prompt描述场景:告诉模型“这是一段客服电话”或“这是医学讲座”,准确率会明显提升。
  2. 用keywords标注专有名词:人名、产品名、药品名等容易听错的词,提前写进keywords。
  3. 用languages指定语言:如果录音里有中英文混说,写成 ["zh", "en"]

七、费用参考

模型 价格 1小时录音成本 适合场景
GPT-Transcribe 0.0045美元/分钟 约1.8元 批量录音、会议回听
GPT-Live-Transcribe 0.017美元/分钟 约7.3元 直播字幕、实时会议
Whisper 旧模型,逐渐被替代 已有项目迁移中

八、国内替代方案

如果你暂时无法使用OpenAI API,这些国内工具也能实现类似效果:

  • 通义听悟:阿里云出品,支持会议记录、音视频转写,每天有免费额度。
  • 讯飞听见:科大讯飞产品,中文识别准确率高,适合采访和会议。
  • 飞书妙记:上传音视频自动生成文字稿和会议纪要,免费好用。

以上就是OpenAI新转录模型的完整上手教程。只要有API Key和一段录音,5分钟就能跑通。如果你用上了,欢迎回来分享效果。

分享给朋友