给 AI 助手装个「耳朵」:Groq 免费语音转文字实战指南
微信里发条语音,1-3 秒后 AI 助手回你一行简体字——这是给自部署助手接上 Groq 免费语音识别后最直观的变化。
1-3 秒—— 微信语音出简体字8 小时/天—— 免费档音频额度,个人用不完零内存—— 转写全在云端,本地 0 占用
为什么折腾这个?我的助手 Hermes 跑在一台 2G 内存的小服务器上,打字交互没问题,但人总有懒得打字的时候,语音才是自然输入。
第一版用本地faster-whisper,实测两个问题很现实:「收到」被识别成「抽到」,口语词错得更多;转写一条语音占 400-500MB 内存,2G 的机器转完基本没余量干别的。
换成云端 Groq Whisper 后,中文错字基本消失,内存零占用,免费档约 8 小时音频/天个人用不完。
整条路走完踩了两个坑——访问限制、默认出繁体——各有各的解法。下面六步照抄即可,所有命令都是我实测过的。
1. 选型:先本地,再云端
本地 faster-whisper 一句话总结:能用,但不好用。
| 对比项 | 本地faster-whisper | 云端 Groq Whisper |
|---|---|---|
| 中文识别 | base模型一般,「收到」识别成「抽到」,助手根本接不住话 | 明显更准,base模型那些错字基本消失 |
| 内存占用 | 转写一条占 400-500MB,2G 的机器转完基本没余量干别的 | 零占用,识别在云端完成 |
| 免费额度 | 无,消耗本地资源 | 约 8 小时音频/天,个人用量用不完 |
2. 上手:六步走完
2.1 注册
打开 Groq 控制台 注册,进 API Keys 页面 Create API Key,复制保存。📌 key 只显示一次,丢了只能重新生成。注意:Groq 需要魔法访问。
2.2 写 .env
key 放进 Hermes 根目录的.env(本机是/root/.hermes/.env),加一行:
# .env GROQ_API_KEY=你的key📌 这个文件权限要收紧,别让别的用户读到:
chmod 600 /root/.hermes/.env2.3 配stt
config.yaml里加:
# config.yaml stt: provider: groq language: zh模型默认就是whisper-large-v3-turbo,端点https://api.groq.com/openai/v1,一般不用改。想换模型,在.env里设STT_GROQ_MODEL和GROQ_BASE_URL即可,详见 Groq API 文档。
2.4 访问限制(坑 1:无法直连)
⚠️坑 1:访问限制
现象:部分网络环境下无法直接访问 Groq(
HTTP 403)。原因:Groq 服务有区域限制。
解决:需要魔法访问,自行解决。
2.5opencc补丁(坑 2:默认出繁体)
⚠️坑 2:默认出繁体
现象:中文识别出来了,但全是繁体字。
原因:
whisper-large-v3-turbo中文默认输出繁体,没有现成的「简体优先」参数。解法:转写结果过一遍 opencc,
t2s(繁转简)。
改 Hermes 的转写文件/usr/local/lib/hermes-agent/tools/transcription_tools.py,在_transcribe_groq函数里找到这行:
# transcription_tools.py 定位 transcript_text = str(transcription).strip()在它后面插入:
# transcription_tools.py 插入 try: from opencc import OpenCC transcript_text = OpenCC("t2s").convert(transcript_text) except Exception: pass装依赖(这步最容易漏):
pip install opencc-python-reimplemented📌opencc库不装,上面那段try会静默失败,繁体照旧——表现就是「明明打了补丁还是繁体」。我 2026-08 装到的版本文件里已经内置了这段转换,如果你的版本没有,照上面手动加。
改文件前先备份,可随时回滚:
cp /usr/local/lib/hermes-agent/tools/transcription_tools.py{,.bak-groq}改完重启 Hermes 让补丁生效(本机网关是systemd服务:sudo systemctl restart hermes-gateway;其他部署方式重启对应进程即可)。
2.6 验证 ✅
微信发一条语音,1-3 秒应该回一行简体字。两条判断:
- 出字慢或报错 → 确认能正常访问 Groq(需要魔法),
curl一下https://api.groq.com看通不通 - 出字了但是繁体 →
opencc依赖没装或补丁没生效,重启后再试
3. 效果
- ✅1-3 秒出简体字—— 微信发语音,直接进对话流程
- ✅零内存负担—— 识别全在云端,服务器不占资源
- ✅免费额度充足—— 约 8 小时/天,个人用不完
4. 总结
小服务器跑 AI 助手,资源是硬约束。本地方案「能用」和「好用」之间,差着一条内存线;云端方案把这条线抹掉了。
两个坑——访问限制、繁体输出——前者需要魔法,后者打段opencc补丁,都容易解决。
如果你也在小机器上折腾语音入口,照着上面六步走,这条路可以照抄。卡在哪一步,欢迎留言交流。