HuggingFace开源本地语音Agent霸榜GitHub第一:一条命令,不联网也能语音对话

Published on: 2026-08-02

你有没有想过一个问题:为什么Siri、小爱同学、天猫精灵这些语音助手,断网就变砖?

不是它们不想离线工作。是整套语音对话流水线——听清你说什么(语音识别)、理解你的意思(大模型)、合成回复语音(语音合成)——全部跑在云端。网一断,链路就断了。

Hugging Face 刚刚开源了一个项目,把这条流水线完整搬到了本地。它叫 speech-to-speech,GitHub 热榜第一,Star 数暴涨 264%。一句话说清楚它做了什么:让你不联网也能跟 AI 语音聊天,而且整套模型全开源。

配图}

它到底做了什么?

📖 名词释义

AI Box(又称 AI盒子 / 智能体计算机 / Agent Computer),是一种专门运行 AI Agent 的本地硬件设备,预装智能体应用管理系统,开箱即用,7×24 小时在线运行。用户可以通过微信、飞书、企业微信、钉钉等社交软件远程指挥 AI 帮你干活。

speech-to-speech 本质上是一条四阶段流水线,每个阶段跑在独立的线程里,靠队列串联:

  1. VAD(语音活动检测):用 Silero VAD v5 模型实时判断"你开始说话了"和"你说完了"
  2. STT(语音转文字):把你的语音转成文本,默认用 Parakeet TDT,也支持 Faster Whisper、Whisper MLX、Paraformer
  3. LLM(大模型):理解你的意思并生成回复,走 OpenAI 兼容协议——可以接云端 API,也可以接本地部署的 vLLM 或 llama.cpp
  4. TTS(文字转语音):把回复合成语音播出来,默认用 Qwen3-TTS,也支持 Kokoro-82M、Pocket TTS、ChatTTS

四个环节全部可替换。STT 不喜欢 Parakeet?换 Whisper。TTS 想要更自然的?换 Kokoro。LLM 想省钱?用本地 Gemma 4 跑 llama.cpp,API 费用是零。

整套对外暴露成一个 OpenAI Realtime 兼容的 WebSocket 接口(ws://localhost:8765/v1/realtime),任何支持 OpenAI Realtime 协议的客户端都能直接接入。

一条命令跑起来

安装简单到离谱:

pip install speech-to-speech
export OPENAI_API_KEY=你的key
speech-to-speech

三行搞定。服务启动后,它在本机 8765 端口跑 WebSocket,用 Parakeet 做本地语音识别、用你指定的 LLM 做理解、用 Qwen3-TTS 做本地语音合成。

如果想完全离线——LLM 也不用云端——用 llama.cpp 在本地跑一个模型就行:

# 先拉一个本地模型,比如 Gemma 4
llama-server -hf ggml-org/gemma-4-E4B-it-GGUF -np 2 -c 65536 -fa on --swa-full

# 让 speech-to-speech 把 LLM 请求指向本地
speech-to-speech   --model_name "ggml-org/gemma-4-E4B-it-GGUF"   --responses_api_base_url "http://127.0.0.1:8080/v1"   --responses_api_api_key ""

到这一步,你的电脑就变成了一个完全离线的语音助手。拔网线也能聊。

配图}

为什么这件事值得关注?

三个原因。

第一,语音交互终于可以在本地跑了。 以前做本地语音助手,要自己搭 STT、自己调 TTS、自己写 WebSocket 服务、自己对接 LLM。随便哪个环节出问题,整个项目卡住。speech-to-speech 把这四个环节打包成一条 pip install 命令。Hugging Face 已经把它用在了几千台 Reachy Mini 机器人上作为对话后端。

第二,全模块化,可以按需拼装。 你想用最快的 STT(Parakeet TDT)、最自然的 TTS(Kokoro-82M)、最强的 LLM(Claude Opus 5),可以。你想全用本地模型、一分钱不花,也可以。每个环节都有一堆可选项,而且切换只需要改 CLI 参数。

第三,OpenAI Realtime 兼容接口。 这意味着市面上所有支持 OpenAI Realtime API 的应用——语音助手 App、智能硬件、机器人——不需要改代码就能从云端切到本地。这对隐私敏感的场景(医院、律所、军工厂)是刚需。

跟铠盒 AIBOX 的天然契合

到这里你可能已经想到了:一套完全离线的语音对话引擎,配上一台 7×24 小时在线的本地 AI 主机,会是什么效果?

把 speech-to-speech 部署在铠盒 AIBOX 上,你就拥有了一个永远在线的本地语音助手。不用开电脑、不用联网、不用担心对话录音被上传到某个服务器——

  • 早上起床,对着铠盒说一句"今天有什么安排",它用本地模型检索你的日程和待办,合成语音播给你听
  • 做饭时手上沾着油,直接喊"帮我把刚才那个菜谱的第二步念一下",它从本地记忆里调出来,念给你听
  • 睡前跟它说"帮我记一下,明天提醒我联系张总",第二天准时提醒

全程语音交互,全程本地处理。你的声音不出你家门,你的对话记录不经过任何服务器。AI 语音助手不再是"别人的服务器在帮你听",而是"你自己的机器在帮你听"。

更重要的是,铠盒 AIBOX 的本地永久记忆 + speech-to-speech 的语音交互 = 一个真正懂你的私人语音管家。你跟它聊得越多,它记得越多。云端语音助手是"用完即忘",铠盒上的语音助手是"越用越懂你"。

上手建议

试试最低成本方案:在铠盒 AIBOX 上装 speech-to-speech,LLM 用本地 Gemma 4(免费,质量够用),TTS 用 Qwen3-TTS,搭配铠盒自带的 Hermes Agent 做任务执行。花半小时搭好,然后试着用语音而不是打字来跟 AI 交互。

你会发现一个有趣的变化:打字交互是"有事才问",语音交互是"随时能聊"。后者的使用频率和依赖度,是前者的好几倍。

开源语音助手的时代,从今天正式开始了。

推荐产品

铠盒 A1 家用入门款 铠盒 A1 Pro 增强款 铠盒 A2 专业款 铠盒 A2 Pro 进阶款 铠盒 X1 企业款 铠盒 G1 旗舰款
© KAIHE AI - Agent Computer Specialist