给 AI 助手装个「耳朵」:Groq 免费语音转文字实战指南

微信里发条语音,1-3 秒后 AI 助手回你一行简体字——这是给自部署助手接上 Groq 免费语音识别后最直观的变化。

1-3 秒—— 微信语音出简体字8 小时/天—— 免费档音频额度,个人用不完零内存—— 转写全在云端,本地 0 占用

为什么折腾这个?我的助手 Hermes 跑在一台 2G 内存的小服务器上,打字交互没问题,但人总有懒得打字的时候,语音才是自然输入。

第一版用本地faster-whisper,实测两个问题很现实:「收到」被识别成「抽到」,口语词错得更多;转写一条语音占 400-500MB 内存,2G 的机器转完基本没余量干别的。

换成云端 Groq Whisper 后,中文错字基本消失,内存零占用,免费档约 8 小时音频/天个人用不完。

整条路走完踩了两个坑——访问限制、默认出繁体——各有各的解法。下面六步照抄即可,所有命令都是我实测过的。

1. 选型:先本地,再云端

本地 faster-whisper 一句话总结:能用,但不好用

对比项本地faster-whisper云端 Groq Whisper
中文识别base模型一般,「收到」识别成「抽到」,助手根本接不住话明显更准,base模型那些错字基本消失
内存占用转写一条占 400-500MB,2G 的机器转完基本没余量干别的零占用,识别在云端完成
免费额度无,消耗本地资源约 8 小时音频/天,个人用量用不完

2. 上手:六步走完

2.1 注册

打开 Groq 控制台 注册,进 API Keys 页面 Create API Key,复制保存。📌 key 只显示一次,丢了只能重新生成。注意:Groq 需要魔法访问。

2.2 写 .env

key 放进 Hermes 根目录的.env(本机是/root/.hermes/.env),加一行:

# .env GROQ_API_KEY=你的key

📌 这个文件权限要收紧,别让别的用户读到:

chmod 600 /root/.hermes/.env

2.3 配stt

config.yaml里加:

# config.yaml stt: provider: groq language: zh

模型默认就是whisper-large-v3-turbo,端点https://api.groq.com/openai/v1,一般不用改。想换模型,在.env里设STT_GROQ_MODELGROQ_BASE_URL即可,详见 Groq API 文档。

2.4 访问限制(坑 1:无法直连)

⚠️坑 1:访问限制

现象:部分网络环境下无法直接访问 Groq(HTTP 403)。

原因:Groq 服务有区域限制。

解决:需要魔法访问,自行解决。

2.5opencc补丁(坑 2:默认出繁体)

⚠️坑 2:默认出繁体

现象:中文识别出来了,但全是繁体字。

原因:whisper-large-v3-turbo中文默认输出繁体,没有现成的「简体优先」参数。

解法:转写结果过一遍 opencc,t2s(繁转简)。

改 Hermes 的转写文件/usr/local/lib/hermes-agent/tools/transcription_tools.py,在_transcribe_groq函数里找到这行:

# transcription_tools.py 定位 transcript_text = str(transcription).strip()

在它后面插入:

# transcription_tools.py 插入 try: from opencc import OpenCC transcript_text = OpenCC("t2s").convert(transcript_text) except Exception: pass

装依赖(这步最容易漏):

pip install opencc-python-reimplemented

📌opencc库不装,上面那段try会静默失败,繁体照旧——表现就是「明明打了补丁还是繁体」。我 2026-08 装到的版本文件里已经内置了这段转换,如果你的版本没有,照上面手动加。

改文件前先备份,可随时回滚:

cp /usr/local/lib/hermes-agent/tools/transcription_tools.py{,.bak-groq}

改完重启 Hermes 让补丁生效(本机网关是systemd服务:sudo systemctl restart hermes-gateway;其他部署方式重启对应进程即可)。

2.6 验证 ✅

微信发一条语音,1-3 秒应该回一行简体字。两条判断:

  • 出字慢或报错 → 确认能正常访问 Groq(需要魔法),curl一下https://api.groq.com看通不通
  • 出字了但是繁体 →opencc依赖没装或补丁没生效,重启后再试

3. 效果

  • 1-3 秒出简体字—— 微信发语音,直接进对话流程
  • 零内存负担—— 识别全在云端,服务器不占资源
  • 免费额度充足—— 约 8 小时/天,个人用不完

4. 总结

小服务器跑 AI 助手,资源是硬约束。本地方案「能用」和「好用」之间,差着一条内存线;云端方案把这条线抹掉了。

两个坑——访问限制、繁体输出——前者需要魔法,后者打段opencc补丁,都容易解决。

如果你也在小机器上折腾语音入口,照着上面六步走,这条路可以照抄。卡在哪一步,欢迎留言交流。