喊一声唤醒词,它就在;问一句,它就答;命令一句,电路就动。
唤醒词在本地识别
不联网也能"喊醒"
多轮上下文记忆
追问不迷路
边说边听
播报中一句话插话
云端大模型生成回答
TTS 合成自然语音
"开灯""关灯"直达 GPIO
AI 真正动手
你说的每一句话都要在电路上走一遭:麦克风把声压变成比特流,主控唤醒、编码、发往云端,大模型想好答案合成语音传回来,最后由 D 类功放推动喇叭——采样、放大、频谱,课本里的概念全在这条链路上。
设备端只负责"听"与"说":采集、唤醒、编解码、播放;语音识别、大模型对话与语音合成都在云端完成,固件通过一套开源语音对话框架与云对接——电路是身体,AI 是大脑,软硬件各司其职。
五块小板、一根喇叭线,就是全部——每块都对应课堂上的一类电路。
双核 240 MHz · Wi-Fi
唤醒 · 编解码 · 联网调度
全向 MEMS · I2S 输出
片上集成 ADC
I2S 输入 · D 类 · 3 W
数字音频直推喇叭
0.96" SSD1306 · I2C
状态与对话一目了然
锂电充放一体 · 5 V 升压
3.3 V 稳压全家供电
真实使用是这样的——最后一句,是电路在执行。
照单采购即可复现,总成本可控制在一百元级。
| 模块 | 参考型号 | 在电路里的角色 |
|---|---|---|
| 主控 | ESP32-S3-N16R8 | 系统中枢:唤醒检测、音频编解码、Wi-Fi 联网 |
| 麦克风 | INMP441 | 拾音:I2S 数字音频采集(片上 ADC) |
| 功放 | MAX98357A | D 类功率放大,推动喇叭发声 |
| 喇叭 | 4 Ω / 3 W | 把电信号还原成声音 |
| 显示 | 0.96" OLED(SSD1306) | 唤醒状态、对话内容显示(I2C 接口) |
| 电源 | TP5400 + 3.7 V 锂电池 | 充电管理 + 5 V 升压,稳压后整机供电 |
| 辅材 | 面包板、杜邦线、外壳 | 装配连接与结构成型 |
对照清单逐一识别:分清 I2S(音频数据)与 I2C(屏幕控制)两种接口,麦克风孔朝外、喇叭极性别接反。
麦克风→主控、主控→功放各走一组 I2S,屏幕走 I2C。口诀:先共地、后信号、最后接电源。
给 ESP32-S3 刷入固件,配置 Wi-Fi 与云端服务。固件基于开源语音对话框架(xiaozhi-esp32)二次配置——识别、对话、合成都在云端,电路只管听与说。
① 唤醒:喊唤醒词,看屏幕点亮;② 对话:连续问答、随时打断;③ 控电路:一句话开关 LED——GPIO 真的被 AI 拉高了。
3D 打印或亚克力外壳,麦克风开孔与喇叭腔对位,一台属于自己的 AI 硬件完工。