Skip to content

第37课 · 语音转文字:让 AI 帮你做会议记录和字幕

本节要点

  • 会议、访谈、视频字幕,AI 都能帮你转文字
  • 用 find-skills 先找现成方案:本地模型免费跑,API 方案按量付费
  • 通义听悟:阿里云出品的零配置在线工具,转写 + 纪要一站搞定
  • 没有现成方案时,可以让 AI 从零帮你写一个语音转文字 Skill
  • ASR、Whisper 等核心概念一次讲清楚

1. 为什么要在 AI 工具里做语音转文字

平时开会、做项目访谈、录视频,最烦的一步就是把语音变成文字。

以前靠人写,现在 AI 时代完全不需要。市面上工具很多:讯飞听见、通义听悟、腾讯会议自带转写……它们都好用,但有个共同问题——它们是独立的,没法直接接进你的工作流

用 OpenCode / Claude Code 这类 AI 工具做语音转文字,好处在于:

  • 语音转文字只是工作流的一环
  • 转完后可以继续让 AI 生成会议纪要、整理成教程、生成 SRT 字幕
  • 所有能力都集中在同一个环境里,不需要在不同软件之间切来切去

比如本课程的文字版教程,就是用语音转文字 + AI 自动整理生成的。一个指令跑下来,从视频到成稿全部自动完成。

💡 本节课讲的不是「用一个独立的转录软件」,而是怎么把语音转文字变成你工作流里的一个原子能力


2. 先搜现成 Skill:find-skills 推荐

第 9 课我们学过 find-skills,专门用来搜索别人已经写好的 Skill。像语音转文字这种通用需求,肯定有现成的。

在 OpenCode 里说:

帮我找一下语音转文字的 skill,区分一下是使用本地模型还是调用的 API,尽量用免费的。

find-skills 会在 skills.sh 等社区搜索,返回很多选项。下面是两类最推荐的方案。

2.1 本地模型方案(免费,吃本地算力)

推荐 steipete/clawdis@openai-whisper(3.9K 安装量)。

它直接调用 OpenAI 开源的 whisper CLI,模型会下载到本地 ~/.cache/whisper,转录时完全离线、完全免费

安装命令:

bash
npx skills add steipete/clawdis --skill openai-whisper -g -y

如果追求速度,也可以选 theplasmak/faster-whisper@faster-whisper(1.4K 安装量)。它基于 CTranslate2 推理引擎,在相同精度下比官方 Whisper 快 4-6 倍,CPU 和 GPU 都能跑。

安装命令:

bash
npx skills add theplasmak/faster-whisper --skill faster-whisper -g -y

本地模型的优缺点:

优点缺点
完全免费,无 API 调用费用首次要下载模型,占用磁盘空间
离线可用,隐私性好速度依赖本地 CPU/GPU
适合批量处理电脑性能差时会很慢

💡 Mac 用户如果已经有本课程环境里安装的 audio-transcribe Skill,它底层用的是 mlx-whisper,对 Apple Silicon 有专门优化,可以优先用它。

2.2 API 方案(按量付费,对电脑没要求)

推荐 steipete/clawdis@openai-whisper-api(2.5K 安装量)。

它调用 OpenAI 兼容的 /v1/audio/transcriptions 接口,默认模型是 gpt-4o-transcribe你可以把 OPENAI_BASE_URL 改成国内的兼容代理,比如硅基流动、阿里云百炼,这样就不需要直连 OpenAI,也更便宜。

安装命令:

bash
npx skills add steipete/clawdis --skill openai-whisper-api -g -y

API 方案的优缺点:

优点缺点
不挑电脑,老旧机器也能用按音频时长计费
速度快,不需要下载模型需要网络,涉及数据上传
通常准确率更高大量使用时成本会上升

国内常用的 ASR API 提供商有:

  • 硅基流动:支持 Whisper 系列模型,价格便宜
  • 阿里云百炼:提供 Fun-ASR、Qwen-ASR 等模型
  • 智谱 AI:也有 ASR 能力

配置示例(以硅基流动为例):

bash
export OPENAI_BASE_URL="https://api.siliconflow.cn/v1"
export OPENAI_API_KEY="你的硅基流动 API Key"

然后在 OpenCode 里调用 Skill 时,AI 会自动读取这两个环境变量,把请求发到国内 API。

💡 如果音频文件不大、频率不高,API 方案最省心。如果每天要处理大量录音,本地模型更划算。


3. 零配置方案:通义听悟

如果你不想装 Skill、不想配模型,只想上传文件就能拿到文字和纪要,推荐阿里云的 通义听悟

官网:https://tingwu.aliyun.com/home

3.1 通义听悟能做什么

通义听悟是阿里云旗下的音视频内容理解工具,核心功能包括:

  • 语音转文字:支持中文、英文、粤语、中英混说、日语、韩语
  • 实时转写:开会时边录边出文字
  • 离线文件转写:上传音视频文件,自动出文字
  • 智能纪要:自动提取全文摘要、章节速览、发言总结、要点回顾、待办事项
  • 翻译:中英日韩德法俄等多语言互译
  • PPT 提取:上传会议视频,自动提取 PPT 画面并生成摘要

3.2 价格

  • 新用户可免费试用 90 天
  • 免费额度:每天 2 小时音频时长
  • 商用后按音频时长计费,语音转文字约 0.6 元/小时(具体以官网最新价格为准)

3.3 适合谁用

场景是否适合
偶尔开会要纪要✅ 非常适合
不想折腾环境✅ 非常适合
要批量处理大量文件⚠️ 成本会上升
要把转录接进 AI 工作流❌ 不适合,它是个独立工具

💡 通义听悟的定位是「独立好用的在线工具」,不是工作流组件。如果你只想快速拿到一份会议纪要,它是最佳选择;如果你想让 AI 自动做后续处理,还是要用 Skill 或 API 方案。


4. 没有现成方案?让 AI 从零帮你做一个

视频里演示了第三种路径:不依赖现成 Skill,直接把需求讲清楚,让 AI 帮你从头写一个

这是 AI 时代最重要的能力——你不需要会写代码,只需要能把需求说清楚

4.1 实战流程

第一步:创建项目文件夹

在电脑上新建一个文件夹,比如 voice-to-text-skill,用 OpenCode 或 Claude Code 打开它。

第二步:描述需求

把下面这段话发给 AI(可以直接用语音输入法说,再让 AI 整理):

我想制作一个语音转文字的 Skill,平时用来把视频或音频转成文字。后续可能还会用来做会议纪要,但目前只需要语音转文字。请遵循 skill creator 的规范,先讨论一下有什么方案。

第三步:让 AI 讨论并选择方案

AI 通常会给出几个方案:

  1. 本地模型方案:用 Whisper / whisper.cpp / faster-whisper
  2. 云端 API 方案:调用硅基流动、阿里云百炼、智谱等 ASR 接口

你可以根据自己的情况选择:

  • 电脑是 Mac 或带显卡的 Windows → 优先本地模型
  • 电脑性能一般,或想快速跑通 → 优先 API 方案

第四步:明确细节

需求越清楚,AI 做得越准。建议提前告诉它:

维度你的选择
输出格式SRT 字幕 / TXT 文本 / Markdown
默认语言中文为主,偶尔有英文专业术语
模型大小small(平衡速度)/ medium(更高精度)
输出位置和原文件放在一起
触发词让 AI 帮你想,比如「转文字」「生成字幕」
是否支持视频需要,先抽音频再转录

第五步:测试并迭代

给 AI 一个测试用的音频或视频文件,让它跑通。跑通后再逐步加功能:

  • 添加云端 API 作为备选
  • 支持 Mac / Windows 兼容
  • 支持会议纪要模板
  • 支持批量处理

4.2 视频里用到的 Hao-one 工具(付费)

视频里还介绍了一个作者自己在用的工具 Hao-one(好译),官网是 https://www.haoai.pro/haoone

它是一个专门为视频剪辑场景优化的语音转文字工具,特点是:

  • 准确率高,对视频字幕友好
  • 支持本地模型和远程 API 两种模式
  • 远程 API 每月有免费额度,基本够用
  • 买断制(当前约 169 元),适合经常剪视频的人
  • 有达芬奇、Premiere 等剪辑软件的插件,可以无缝导入字幕

如果你主要需求是给视频做字幕,Hao-one 值得考虑;如果只是偶尔转会议录音,前面的免费方案完全够用。

Hao-one 也提供了 AI 工具可以调用的 Skill,安装命令:

bash
npx skills add minghe36/haoone-skill

安装后,可以在 OpenCode / Claude Code 里直接调用它来做语音转文字和字幕生成。


5. 专用名词解释

做语音转文字时,你会经常看到这些名词。这里一次讲清楚。

5.1 ASR(Automatic Speech Recognition)

自动语音识别,就是把人类语音转换成文本的技术。

你可以把它理解为:

  • 输入:一段音频
  • 输出:这段音频里说了什么文字

ASR 是很多 AI 产品的底层能力,比如:

  • 微信语音转文字
  • 语音输入法
  • 会议软件实时字幕
  • 视频自动生成字幕

💡 ASR 只负责「听见并写下」,不负责理解内容。理解内容是 LLM(大语言模型)的工作。

5.2 Whisper

Whisper 是 OpenAI 开源的通用语音识别模型,发布于 2022 年。

它的特点是:

  • 多语言:支持 99 种语言
  • 多任务:不仅能转文字,还能做语音翻译、语言识别
  • 鲁棒性强:在嘈杂环境、口音、背景音下表现不错
  • 开源免费:模型和代码都公开,可以本地运行

Whisper 有多个型号,从小到大依次是:

模型参数量显存需求适用场景
tiny39M~1GB最快,精度一般
base74M~1GB速度优先
small244M~2GB日常推荐
medium769M~5GB高精度
large / large-v31550M~10GB最高精度
turbo809M~6GBlarge-v3 的加速版

💡 中文场景日常用 smallmedium 就够了。tinybase 速度最快但容易出错,尤其是专业术语。

5.3 whisper.cpp

whisper.cpp 是 Whisper 的 C++ 重新实现,由 ggerganov 开发。

它的优势:

  • 跨平台(Windows / Mac / Linux / 甚至手机)
  • 支持 Apple Silicon 的 Metal 加速,Mac 上很快
  • 支持量化,小设备也能跑
  • 不需要 Python 环境

Mac 用户如果想本地跑 Whisper,whisper.cpp 通常是最快的选择。

5.4 faster-whisper

faster-whisper 是基于 CTranslate2 推理引擎重写的 Whisper,比官方 PyTorch 版本快很多。

它的优势:

  • CPU 上比官方快 4-6 倍
  • GPU 上更快,适合批量处理
  • 支持 int8 量化,省显存
  • Python API 原生支持,容易集成

适合有 NVIDIA 显卡、需要批量转录的场景。

5.5 SRT

SRT 是一种字幕文件格式,长这样:

1
00:00:01,000 --> 00:00:03,000
大家好,这节课讲语音转文字

每段包含:序号、起止时间、文字内容。视频剪辑软件(达芬奇、Premiere、剪映)都支持直接导入 SRT。


6. 怎么选方案

你的情况推荐方案
不想折腾,偶尔用通义听悟
Mac / 显卡好,要批量处理本地 Whisper / faster-whisper
电脑差,但用量小API 方案(硅基流动 / 百炼)
要接入 AI 工作流用 find-skills 装 Skill,或让 AI 自己写一个
主要给视频做字幕Hao-one

⚠️ 常见问题

本地模型下载很慢怎么办?

Whisper 模型默认从 OpenAI 的 Azure 边缘网络下载,国内可能较慢。可以:

  • 让 AI 使用国内镜像下载
  • 手动下载后放到 ~/.cache/whisper/ 目录
  • 使用已经配置好国内加速的 Skill

转录中文准确率不高?

  • 选更大模型(small → medium → large)
  • 给 AI 指定 language="zh"
  • 加提示词(initial prompt),比如「以下是普通话」
  • 专业术语识别不准时,用支持热词的 API 方案

视频文件能直接转吗?

一般需要先抽音频。大多数 Skill 会用 ffmpeg 自动完成。如果环境里没有 ffmpeg,让 AI 帮你装。

API 方案安全吗?

把音频上传到第三方 API,涉及数据隐私。如果内容是内部会议、客户访谈等敏感信息,建议:

  • 用本地模型
  • 或用企业版 / 私有部署方案

关键收获

TIP

语音转文字已经是一门成熟技术。本节课给了你三条路径:

  1. 现成 Skill:用 find-skills 搜索安装,本地模型免费跑,API 方案按量付费
  2. 零配置工具:通义听悟上传即用,适合不想折腾的人
  3. 自己造一个:把需求说清楚,让 AI 帮你从零写一个专属 Skill

核心认知是:语音转文字不是终点,而是工作流的一环。把它接进 OpenCode / Claude Code,后面可以自动做会议纪要、生成字幕、整理成教程。


下一步

掌握了语音转文字后,你可以试着把它和前面的 Skill 串起来:

  • 会议录音 → 转文字 → 生成 Word 会议纪要
  • 视频文件 → 转字幕 → 导入剪辑软件
  • 访谈录音 → 转文字 → 提取关键信息填入底稿

这些都是把「原子能力」组合成「工作流」的实战练习。


参考链接

© 2025 逆行的狗