
oeadmin з Open Electronics розповідає про проект голосового помічника від jayesh_nawani, який повністю працює на ESP32.
Мікрофон I2S вловлює мову, кліп упаковується як файл WAV і надсилається до API OpenAI Whisper для транскрипції. GPT записує відповідь, а аудіо TTS повертається через підсилювач MAX98357A та динамік 3 Вт. 0,96-дюймовий OLED-дисплей 128 × 64 відображає два анімованих очі, які реагують на режим розмови.
Запис починається, коли тривалий звук переступає поріг, і припиняється після короткої тиші тривалістю до двох секунд. Фотографія працює на частоті 16000 Гц, тоді як перетворення тексту в мовлення працює на частоті 24000 Гц і транслюється фрагментами по 512 байт.
Анімація очей у його завданні FreeRTOS живе на ядрі 0, тоді як аудіо та мережевий конвеєр працює на ядрі 1, тому блокування викликів HTTP блокує екран. Збірка виконується на макетній платі за допомогою Arduino IDE, ArduinoJson, Adafruit_GFX і Adafruit_SSD1306.
Дивіться більше на open-electronics.org.