agenttwo/README.md

2.8 KiB

oxagenttwo

Voice-Chat-Oberfläche für lokale und Cloud-LLMs: lokales Qwen3 über Ollama, optionaler Fallback auf OpenRouter, Spracheingabe via whisper.cpp und deutsche Sprachausgabe via Piper (Stimme: Thorsten).

Aufbau

npm-Workspace mit zwei Paketen:

Pfad Inhalt
server/ Fastify + WebSocket-Backend, Ollama-/OpenRouter-Bridge, STT/TTS, SQLite
web/ React 18 + Vite Frontend, Markdown-Rendering, Voice-Recording

Voraussetzungen

  • Node.js 20+
  • Ollama mit einem Qwen3-Modell (ollama pull qwen3.5)
  • ffmpeg im PATH
  • whisper-cli im PATH (whisper.cpp) inklusive Modell
  • piper im PATH

Unter macOS:

brew install ffmpeg whisper-cpp piper

Whisper-Modell

Wird per Default unter ~/whisper-models/ggml-large-v3-turbo.bin erwartet:

mkdir -p ~/whisper-models
curl -L -o ~/whisper-models/ggml-large-v3-turbo.bin \
  https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-large-v3-turbo.bin

Piper-Stimme

Die Stimmdatei ist nicht im Repo (109 MB, über GitHubs Dateilimit). Einmalig herunterladen:

mkdir -p server/voices
curl -L -o server/voices/de_DE-thorsten-high.onnx \
  https://huggingface.co/rhasspy/piper-voices/resolve/main/de/de_DE/thorsten/high/de_DE-thorsten-high.onnx

Die zugehörige de_DE-thorsten-high.onnx.json liegt bereits im Repo.

Konfiguration

.env im Projekt-Root (wird vom Server eingelesen, ist gitignored):

OPENROUTER_API_KEY=sk-or-...

Weitere optionale Variablen mit ihren Defaults:

Variable Default
PORT 8787
OLLAMA_URL http://localhost:11434
MODEL qwen3.5:latest
WHISPER_MODEL ~/whisper-models/ggml-large-v3-turbo.bin
WHISPER_LANG de
PIPER_MODEL server/voices/de_DE-thorsten-high.onnx

Entwicklung

npm install
npm run dev          # Server (:8787) und Vite-Dev-Server (:5173) parallel

Einzeln:

npm run dev:server
npm run dev:web

Typecheck über beide Workspaces:

npm run typecheck

Produktion

npm start            # baut das Frontend und startet den Server

Der Server bindet bewusst nur an 127.0.0.1 — für externen Zugriff einen Reverse-Proxy davorschalten.