给 Agent 装上耳朵:消费级设备上的语音转文字解决方案
给 Agent 装上耳朵 《人间万象》里提到,我每天的音视频转录量在十几个小时以上。不少朋友问:底下跑的是什么? 2023 年我写过一篇 Whisper 的使用指南(少数派版),算是当时全网介绍得比较全的一篇。前阵子一位高中同学突然找我,说他在搜 Whisper 相关资料时搜到了这篇,点进去才惊喜地发现作者是我——一篇三年前的文章,以这种方式把老同学连上了,挺奇妙的。 三年过去,ASR(自动语音识别,也就是语音转文字)领域变化很大。新模型一茬接一茬,Coding Agent 的能力也让我这种非专业工程师能自己搭整套服务了。但现在的我,已经基本不用 Whisper 了。 音视频里有大量文字世界没有的信息,但只有转成文字,Agent 才读得到。这篇就聊聊,怎么在消费级设备上低成本地给 Agent 装上这对耳朵。还是一贯的思路:你了解个框架就好,具体技术细节留个引子,交给你的 Agent 去读——它结合你的场景讲,肯定比我讲得好。真正值钱的,是实践里踩过的那些坑。 为什么非要在本地跑 在线服务我用得很早。2022 年还写过一篇用飞书妙记提升学习体验的文章,给飞书妙记带去了不少用户;后来也是通义听悟的老用户,云端和本地的模型都折腾过。最后还是落在本地,三个原因。 成本。 在线 ASR 服务大概每小时 0.5 到 1 元。单看不贵,但我每天十几个小时,一个月下来就是几百块。家里的机器反正 24 小时开着,算力不用白不用。 隐私。 音频不出家门。 拒转。 商用服务对有些内容会直接拒绝转录,遇到的时候挺麻烦。而《人间万象》里聊过,音视频最有价值的部分,恰恰是那些没那么"正确"的内容。 需要说明的是,后面的校对环节我用的是云端 LLM API,转录出来的文本还是会出本地。如果对隐私要求更高,校对这一步也完全可以换成本地 LLM。 先说结论:过了及格线,就别卷准确率了 评价一个 ASR 模型,我主要看三件事: 资源占用:显存、内存、CPU。在家用场景里,还得算上 24 小时开机的电费。 速度:业内常用 RTF(Real Time Factor),即转录耗时除以音频时长,越小越快。RTF 0.1 就是 10 倍实时,一小时音频六分钟转完。下文统一用"几倍实时"来说。 质量:转录准确率。 除此之外,还要看支持哪些语种。 我的核心结论是:结合你的场景,在这几者之间取平衡,而不是无脑追求单一指标。 在消费级设备上,开源 ASR 模型的准确率过了一条基线,比如 90% 左右,再往上提,体感就没那么明显了。尤其下游是 AI 总结的时候,更合理的做法是:ASR 打底,配上精准的上下文,让 LLM 再校对一遍。这是我跑下来效果最好、成本最低的方式。 ...