Reachy Mini 语音对话系统快速上手:从录音、声源定位到 TTS 出声的完整指南
Reachy Mini 语音对话系统快速上手从录音、声源定位到 TTS 出声的完整指南【免费下载链接】reachy_miniReachy Minis SDK项目地址: https://gitcode.com/GitHub_Trending/re/reachy_mini你对着桌上的小机器人说了一句话它转过头看向你然后用声音回你——这套语音对话体验在 Reachy Mini 的 SDK 里不需要自己写音频驱动。Reachy Mini 语音对话系统把麦克风阵列、扬声器、声源定位和文本转语音封装成了几个 Python 接口适合刚接触机器人开发、想先跑通听-想-说闭环的开发者。它能替你干的四件事录音→ 几行代码从麦克风阵列拿到 float32 音频流存成 WAV 做后续识别或分析声源定位DoADirection of Arrival→ 机器人自动判断声音从哪个方向来转头看向说话的人播放与 TTS→ 播本地音频文件或把任意文本合成语音后从机器人喇叭播出对话应用脚手架→ 一条命令生成可运行的对话应用骨架接上 LLM 就有了完整对话回路五分钟装好开发环境需要 Python 3.11GStreamer 音视频框架在 Linux 上走系统包、其他平台由依赖自动带入。git clone https://gitcode.com/GitHub_Trending/re/reachy_mini cd reachy_mini pip install -e .核心目录速览examples/— 可照抄运行的录音、播放、声源定位、TTS 演示脚本src/reachy_mini/media/— 音频管道、DoA、WebRTC 等媒体实现src/reachy_mini/apps/— 应用管理与对话应用模板docs/notebooks/— 连接、动作、音频的 Jupyter 分步教程三个真实场景听、转、说场景一先确认机器人耳朵是通的。运行examples/sound_record.py它会录 5 秒并把结果存为recorded_audio.wav。最小用法就是下面这样get_audio_sample()在没拿到数据时返回Nonefrom reachy_mini import ReachyMini with ReachyMini() as mini: mini.media.start_recording() sample mini.media.get_audio_sample() # 没数据时返回 None mini.media.stop_recording()场景二让人在哪头就转向哪。examples/sound_doa.py轮询机器人 8000 端口的/api/state/doa接口拿到说话方向角后调用look_at_world()让头转过去。源码在 src/reachy_mini/media/audio_doa.py示例在 examples/sound_doa.py。场景三让机器人开口。两条路播现成文件用 examples/sound_play.pymini.media.play_sound(路径)即可支持 WAV/OGG/MP3要把文字变成声音用 examples/sound_tts.py它调用 Chatterbox 多语言 TTS 服务合成后直接播出来还支持enable_wobbling()让头随语音节奏摆动。动手四步让机器人开口跑录音示例python examples/sound_record.py预期看到Audio saved to recorded_audio.wav文件里能听到自己的声音。跑播放示例python examples/sound_play.py --file 任意音频.wav预期机器人喇叭出声播完提示结束。跑声源定位python examples/sound_doa.py站到机器人左侧说话预期控制台打印角度并看到它把头转过来。跑 TTSuv run python examples/sound_tts.py --text 你好我在听 --lang zh预期听到机器人用合成的声音念出这句话。想从脚手架起步做完整对话应用运行官方入口reachy-mini-app-assistant由pyproject.toml注册的控制台命令按提示选择应用类型会得到一个可直接改的对话应用工程模板逻辑在 src/reachy_mini/apps/assistant.py。排坑速查现象 → 原因 → 解法录音一直返回None→ 麦克风未就绪或媒体后端不对 → 用--backend指定default、local、webrtc中与你硬件匹配的一个播放卡顿、延迟明显→ 一次性推大块音频 → 按sound_play.py的做法以20ms 一块调push_audio_sample()头来回抖动→ 声源角度阈值太小 → 照示例把THRESHOLD设为0.004约 2 度角度变化小于它就不转头Linux 上找不到 GStreamer→ 该包只在非 Linux 平台随依赖安装 → 用系统包管理器装 gstreamer 及 alsa 依赖识别不到音频设备→ 检查设备枚举与系统音频服务 → 参考仓库docs/source/troubleshooting/下的排障文档收尾清单照着过一遍pip install -e .安装成功能import reachy_minisound_record.py产出的 WAV 里有声音sound_play.py能从机器人喇叭播出来sound_doa.py让它转头看向你sound_tts.py让它用合成语音说一句话更完整的 API 参考与分步教程见 docs/source/SDK/python-sdk.md下一个小时就去跑一遍examples/sound_doa.py。【免费下载链接】reachy_miniReachy Minis SDK项目地址: https://gitcode.com/GitHub_Trending/re/reachy_mini创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考