第37课 · 语音转文字:让 AI 帮你做会议记录和字幕
本节要点
- 会议、访谈、视频字幕,AI 都能帮你转文字
- 用 find-skills 先找现成方案:本地模型免费跑,API 方案按量付费
- 通义听悟:阿里云出品的零配置在线工具,转写 + 纪要一站搞定
- 没有现成方案时,可以让 AI 从零帮你写一个语音转文字 Skill
- ASR、Whisper 等核心概念一次讲清楚
1. 为什么要在 AI 工具里做语音转文字
平时开会、做项目访谈、录视频,最烦的一步就是把语音变成文字。
以前靠人写,现在 AI 时代完全不需要。市面上工具很多:讯飞听见、通义听悟、腾讯会议自带转写……它们都好用,但有个共同问题——它们是独立的,没法直接接进你的工作流。
用 OpenCode / Claude Code 这类 AI 工具做语音转文字,好处在于:
- 语音转文字只是工作流的一环
- 转完后可以继续让 AI 生成会议纪要、整理成教程、生成 SRT 字幕
- 所有能力都集中在同一个环境里,不需要在不同软件之间切来切去
比如本课程的文字版教程,就是用语音转文字 + AI 自动整理生成的。一个指令跑下来,从视频到成稿全部自动完成。
💡 本节课讲的不是「用一个独立的转录软件」,而是怎么把语音转文字变成你工作流里的一个原子能力。
2. 先搜现成 Skill:find-skills 推荐
第 9 课我们学过 find-skills,专门用来搜索别人已经写好的 Skill。像语音转文字这种通用需求,肯定有现成的。
在 OpenCode 里说:
帮我找一下语音转文字的 skill,区分一下是使用本地模型还是调用的 API,尽量用免费的。
find-skills 会在 skills.sh 等社区搜索,返回很多选项。下面是两类最推荐的方案。
2.1 本地模型方案(免费,吃本地算力)
推荐 steipete/clawdis@openai-whisper(3.9K 安装量)。
它直接调用 OpenAI 开源的 whisper CLI,模型会下载到本地 ~/.cache/whisper,转录时完全离线、完全免费。
安装命令:
npx skills add steipete/clawdis --skill openai-whisper -g -y如果追求速度,也可以选 theplasmak/faster-whisper@faster-whisper(1.4K 安装量)。它基于 CTranslate2 推理引擎,在相同精度下比官方 Whisper 快 4-6 倍,CPU 和 GPU 都能跑。
安装命令:
npx skills add theplasmak/faster-whisper --skill faster-whisper -g -y本地模型的优缺点:
| 优点 | 缺点 |
|---|---|
| 完全免费,无 API 调用费用 | 首次要下载模型,占用磁盘空间 |
| 离线可用,隐私性好 | 速度依赖本地 CPU/GPU |
| 适合批量处理 | 电脑性能差时会很慢 |
💡 Mac 用户如果已经有本课程环境里安装的
audio-transcribeSkill,它底层用的是 mlx-whisper,对 Apple Silicon 有专门优化,可以优先用它。
2.2 API 方案(按量付费,对电脑没要求)
推荐 steipete/clawdis@openai-whisper-api(2.5K 安装量)。
它调用 OpenAI 兼容的 /v1/audio/transcriptions 接口,默认模型是 gpt-4o-transcribe。你可以把 OPENAI_BASE_URL 改成国内的兼容代理,比如硅基流动、阿里云百炼,这样就不需要直连 OpenAI,也更便宜。
安装命令:
npx skills add steipete/clawdis --skill openai-whisper-api -g -yAPI 方案的优缺点:
| 优点 | 缺点 |
|---|---|
| 不挑电脑,老旧机器也能用 | 按音频时长计费 |
| 速度快,不需要下载模型 | 需要网络,涉及数据上传 |
| 通常准确率更高 | 大量使用时成本会上升 |
国内常用的 ASR API 提供商有:
- 硅基流动:支持 Whisper 系列模型,价格便宜
- 阿里云百炼:提供 Fun-ASR、Qwen-ASR 等模型
- 智谱 AI:也有 ASR 能力
配置示例(以硅基流动为例):
export OPENAI_BASE_URL="https://api.siliconflow.cn/v1"
export OPENAI_API_KEY="你的硅基流动 API Key"然后在 OpenCode 里调用 Skill 时,AI 会自动读取这两个环境变量,把请求发到国内 API。
💡 如果音频文件不大、频率不高,API 方案最省心。如果每天要处理大量录音,本地模型更划算。
3. 零配置方案:通义听悟
如果你不想装 Skill、不想配模型,只想上传文件就能拿到文字和纪要,推荐阿里云的 通义听悟。
官网:https://tingwu.aliyun.com/home
3.1 通义听悟能做什么
通义听悟是阿里云旗下的音视频内容理解工具,核心功能包括:
- 语音转文字:支持中文、英文、粤语、中英混说、日语、韩语
- 实时转写:开会时边录边出文字
- 离线文件转写:上传音视频文件,自动出文字
- 智能纪要:自动提取全文摘要、章节速览、发言总结、要点回顾、待办事项
- 翻译:中英日韩德法俄等多语言互译
- PPT 提取:上传会议视频,自动提取 PPT 画面并生成摘要
3.2 价格
- 新用户可免费试用 90 天
- 免费额度:每天 2 小时音频时长
- 商用后按音频时长计费,语音转文字约 0.6 元/小时(具体以官网最新价格为准)
3.3 适合谁用
| 场景 | 是否适合 |
|---|---|
| 偶尔开会要纪要 | ✅ 非常适合 |
| 不想折腾环境 | ✅ 非常适合 |
| 要批量处理大量文件 | ⚠️ 成本会上升 |
| 要把转录接进 AI 工作流 | ❌ 不适合,它是个独立工具 |
💡 通义听悟的定位是「独立好用的在线工具」,不是工作流组件。如果你只想快速拿到一份会议纪要,它是最佳选择;如果你想让 AI 自动做后续处理,还是要用 Skill 或 API 方案。
4. 没有现成方案?让 AI 从零帮你做一个
视频里演示了第三种路径:不依赖现成 Skill,直接把需求讲清楚,让 AI 帮你从头写一个。
这是 AI 时代最重要的能力——你不需要会写代码,只需要能把需求说清楚。
4.1 实战流程
第一步:创建项目文件夹
在电脑上新建一个文件夹,比如 voice-to-text-skill,用 OpenCode 或 Claude Code 打开它。
第二步:描述需求
把下面这段话发给 AI(可以直接用语音输入法说,再让 AI 整理):
我想制作一个语音转文字的 Skill,平时用来把视频或音频转成文字。后续可能还会用来做会议纪要,但目前只需要语音转文字。请遵循 skill creator 的规范,先讨论一下有什么方案。
第三步:让 AI 讨论并选择方案
AI 通常会给出几个方案:
- 本地模型方案:用 Whisper / whisper.cpp / faster-whisper
- 云端 API 方案:调用硅基流动、阿里云百炼、智谱等 ASR 接口
你可以根据自己的情况选择:
- 电脑是 Mac 或带显卡的 Windows → 优先本地模型
- 电脑性能一般,或想快速跑通 → 优先 API 方案
第四步:明确细节
需求越清楚,AI 做得越准。建议提前告诉它:
| 维度 | 你的选择 |
|---|---|
| 输出格式 | SRT 字幕 / TXT 文本 / Markdown |
| 默认语言 | 中文为主,偶尔有英文专业术语 |
| 模型大小 | small(平衡速度)/ medium(更高精度) |
| 输出位置 | 和原文件放在一起 |
| 触发词 | 让 AI 帮你想,比如「转文字」「生成字幕」 |
| 是否支持视频 | 需要,先抽音频再转录 |
第五步:测试并迭代
给 AI 一个测试用的音频或视频文件,让它跑通。跑通后再逐步加功能:
- 添加云端 API 作为备选
- 支持 Mac / Windows 兼容
- 支持会议纪要模板
- 支持批量处理
4.2 视频里用到的 Hao-one 工具(付费)
视频里还介绍了一个作者自己在用的工具 Hao-one(好译),官网是 https://www.haoai.pro/haoone。
它是一个专门为视频剪辑场景优化的语音转文字工具,特点是:
- 准确率高,对视频字幕友好
- 支持本地模型和远程 API 两种模式
- 远程 API 每月有免费额度,基本够用
- 买断制(当前约 169 元),适合经常剪视频的人
- 有达芬奇、Premiere 等剪辑软件的插件,可以无缝导入字幕
如果你主要需求是给视频做字幕,Hao-one 值得考虑;如果只是偶尔转会议录音,前面的免费方案完全够用。
Hao-one 也提供了 AI 工具可以调用的 Skill,安装命令:
npx skills add minghe36/haoone-skill安装后,可以在 OpenCode / Claude Code 里直接调用它来做语音转文字和字幕生成。
5. 专用名词解释
做语音转文字时,你会经常看到这些名词。这里一次讲清楚。
5.1 ASR(Automatic Speech Recognition)
自动语音识别,就是把人类语音转换成文本的技术。
你可以把它理解为:
- 输入:一段音频
- 输出:这段音频里说了什么文字
ASR 是很多 AI 产品的底层能力,比如:
- 微信语音转文字
- 语音输入法
- 会议软件实时字幕
- 视频自动生成字幕
💡 ASR 只负责「听见并写下」,不负责理解内容。理解内容是 LLM(大语言模型)的工作。
5.2 Whisper
Whisper 是 OpenAI 开源的通用语音识别模型,发布于 2022 年。
它的特点是:
- 多语言:支持 99 种语言
- 多任务:不仅能转文字,还能做语音翻译、语言识别
- 鲁棒性强:在嘈杂环境、口音、背景音下表现不错
- 开源免费:模型和代码都公开,可以本地运行
Whisper 有多个型号,从小到大依次是:
| 模型 | 参数量 | 显存需求 | 适用场景 |
|---|---|---|---|
| tiny | 39M | ~1GB | 最快,精度一般 |
| base | 74M | ~1GB | 速度优先 |
| small | 244M | ~2GB | 日常推荐 |
| medium | 769M | ~5GB | 高精度 |
| large / large-v3 | 1550M | ~10GB | 最高精度 |
| turbo | 809M | ~6GB | large-v3 的加速版 |
💡 中文场景日常用
small或medium就够了。tiny和base速度最快但容易出错,尤其是专业术语。
5.3 whisper.cpp
whisper.cpp 是 Whisper 的 C++ 重新实现,由 ggerganov 开发。
它的优势:
- 跨平台(Windows / Mac / Linux / 甚至手机)
- 支持 Apple Silicon 的 Metal 加速,Mac 上很快
- 支持量化,小设备也能跑
- 不需要 Python 环境
Mac 用户如果想本地跑 Whisper,whisper.cpp 通常是最快的选择。
5.4 faster-whisper
faster-whisper 是基于 CTranslate2 推理引擎重写的 Whisper,比官方 PyTorch 版本快很多。
它的优势:
- CPU 上比官方快 4-6 倍
- GPU 上更快,适合批量处理
- 支持 int8 量化,省显存
- Python API 原生支持,容易集成
适合有 NVIDIA 显卡、需要批量转录的场景。
5.5 SRT
SRT 是一种字幕文件格式,长这样:
1
00:00:01,000 --> 00:00:03,000
大家好,这节课讲语音转文字每段包含:序号、起止时间、文字内容。视频剪辑软件(达芬奇、Premiere、剪映)都支持直接导入 SRT。
6. 怎么选方案
| 你的情况 | 推荐方案 |
|---|---|
| 不想折腾,偶尔用 | 通义听悟 |
| Mac / 显卡好,要批量处理 | 本地 Whisper / faster-whisper |
| 电脑差,但用量小 | API 方案(硅基流动 / 百炼) |
| 要接入 AI 工作流 | 用 find-skills 装 Skill,或让 AI 自己写一个 |
| 主要给视频做字幕 | Hao-one |
⚠️ 常见问题
本地模型下载很慢怎么办?
Whisper 模型默认从 OpenAI 的 Azure 边缘网络下载,国内可能较慢。可以:
- 让 AI 使用国内镜像下载
- 手动下载后放到
~/.cache/whisper/目录 - 使用已经配置好国内加速的 Skill
转录中文准确率不高?
- 选更大模型(small → medium → large)
- 给 AI 指定
language="zh" - 加提示词(initial prompt),比如「以下是普通话」
- 专业术语识别不准时,用支持热词的 API 方案
视频文件能直接转吗?
一般需要先抽音频。大多数 Skill 会用 ffmpeg 自动完成。如果环境里没有 ffmpeg,让 AI 帮你装。
API 方案安全吗?
把音频上传到第三方 API,涉及数据隐私。如果内容是内部会议、客户访谈等敏感信息,建议:
- 用本地模型
- 或用企业版 / 私有部署方案
关键收获
TIP
语音转文字已经是一门成熟技术。本节课给了你三条路径:
- 现成 Skill:用 find-skills 搜索安装,本地模型免费跑,API 方案按量付费
- 零配置工具:通义听悟上传即用,适合不想折腾的人
- 自己造一个:把需求说清楚,让 AI 帮你从零写一个专属 Skill
核心认知是:语音转文字不是终点,而是工作流的一环。把它接进 OpenCode / Claude Code,后面可以自动做会议纪要、生成字幕、整理成教程。
下一步
掌握了语音转文字后,你可以试着把它和前面的 Skill 串起来:
- 会议录音 → 转文字 → 生成 Word 会议纪要
- 视频文件 → 转字幕 → 导入剪辑软件
- 访谈录音 → 转文字 → 提取关键信息填入底稿
这些都是把「原子能力」组合成「工作流」的实战练习。
参考链接
- OpenAI Whisper 官方介绍:https://openai.com/zh-Hans-CN/index/whisper/
- faster-whisper 对比介绍:https://dibi8.com/zh/resources/ai-tools/faster-whisper/
- 通义听悟:https://tingwu.aliyun.com/home
- 阿里云百炼 ASR:https://help.aliyun.com/zh/model-studio/asr-model