OpenAI Whisper 是什么
Whisper 是 OpenAI 的语音识别模型家族,值得注意的地方在于它是开放权重的:你可以下载模型并在自己的硬件上运行它。它把语音音频转成文字,多语言准确度很强,而且自带能输出纯转录、词级时间戳与字幕文件的工具。实际上,Whisper 是许多转写应用背后的默认引擎——而对在意隐私的人,它是那个你能运行、且没有任何数据离开机器的选择。
这份评测反映的是在访谈音频、会议录音与短视频片段上本地运行大模型与中型模型,包括普通话与带口音的英语。
适合谁使用
Whisper 适合任何经常做转写、并且要么有点技术耐心、要么在它外面用一层包装工具的人。视频创作者用它一条命令生成 SRT 字幕。记者与研究者用它把访谈录音变成可搜索的文字。法律、医疗或金融领域里注重隐私的用户之所以选自建的 Whisper,正是因为音频从不碰到第三方服务器。如果你想要零配置和一个图形化编辑器,Descript 把类似的转写包装在一个打磨过的时间线后面。
价格构成
Whisper 有一个不寻常的定价故事:核心产品免费且开源。自己运行它只花算力——跑在朋友的显卡上免费,或者在租的实例上大约每小时音频几分钱。OpenAI 也卖一个按分钟计费的托管 API,当你更看重便利而不是控制时它是正确的选择。对大多数个人用户来说,实际问题不是价格,而是你有没有那块硬件、或者愿不愿意用一个托管的包装服务。
实际使用记录
在干净的访谈音频上,中型模型产出的转录只需要轻度清理。在嘈杂或有口音的音频上,大型模型明显更可靠,代价是速度。最大的实际陷阱是近乎静音处的幻觉:长时间停顿与背景音乐可能造出凭空编出的句子,所以永远要拿原文抽查转录,而不是盲目相信输出。
我们喜欢的地方
开放权重、强多语言准确度与字幕文件输出的组合,在这个价格上无人能敌。能在自己的硬件上转写一小时音频——没有上传、没有按分钟费用——让 Whisper 成为隐私友好工作流的骨干。命令行用法一旦配好非常简单,而包装工具在你想要图形界面时能补上。
需要留意什么
配置摩擦是主要成本:你需要 Python、正确的 PyTorch 构建,以及处理长文件时最好有 CUDA 显卡。纯 CPU 转写一段一小时录音可能要很久。静音与音乐上的幻觉是真实存在的,应该被检查。而且托管 API 虽然省掉了配置,同时也去掉了本地处理的隐私保证——按你的音频实际内容来选。另外 Whisper 是错的工具,当你需要的是一个界面而不是一个引擎:如果你想点一个按钮、看说话人标签、并在打磨过的时间线里编辑转写,Descript 这类产品把转写与编辑包在一起——代价是把音频上传到它的云。而当你的音频大部分是音乐或严重背景噪声时,Whisper 也会吃力,它可能为了让静音有内容而凭空造词;这类文件先把音轨清理干净,或者为仔细的人工复核留出预算。硬件问题同样重要:短片段在几乎任何东西上都能跑,但只有 CPU 的笔记本上一小时播客意味着长时间等待。如果那是你的处境,租几分钟 GPU 或者用一个隐私政策够强的托管转写 API,可能比一次缓慢的本地运行更实际——只要把隐私取舍与你的音频内容权衡清楚。
实用配置建议
先用中型模型做一次快速质量测试,然后为重要文件换到大型。给输出保持一个稳定的命名约定(episode-01.srt),这样字幕在你的编辑器里容易挂上。做访谈时在安静的房间录、让麦克风靠近;Whisper 的准确度受背景噪声的影响远大于受口音差异的影响。而永远要抽查数字、人名与技术术语——这个模型无从知道你的特定行话该怎么拼。
值得一看的替代品
- Descript —— 一个完整的编辑工作室,你改转录、视频跟着改。
- HandBrake —— 把你做完、加好字幕的视频压缩成便于社交平台快速上传的版本。
优点与缺点
✓ 我们认可的地方
- 开放权重模型,可以完全离线运行
- 输出结构化转录加 SRT/VTT/JSON
- 用一块不算贵的显卡自建就是免费
! 需要留意的地方
- 本地配置需要 Python 与一块像样的显卡才能处理长文件
- 基础模型在静音与音乐较多的音频上会产生幻觉
- 除非自己加一层外壳,否则没有内建界面
- 在只有 CPU 的机器上跑大模型很慢
替代选择
值得一并看看的相似工具,以及它们的差异。
常见问题
Whisper 免费吗?
模型权重是开源的,所以自托管除算力外不花钱。OpenAI 也提供按音频分钟计费的托管 API,免去本地搭建。
它能处理英语以外的语言吗?
能,Whisper 在多语言数据上训练,能可靠处理普通话等语言,包括语码转换,而更大的模型尺寸会带来明显更好的效果。
它能输出哪些格式?
纯文本、片段级 JSON,以及 SRT、VTT 等可直接使用的字幕格式,这让它非常适合给视频加字幕。
对多人会议的准确率如何?
转写准确率很高,但 Whisper 不区分说话人,如果你需要说话人标签,请用 Descript 之类的工具或专门的说话人分离步骤。