docs+fix: qwen3:8b als durchgaengigen Default statt qwen3.5:latest

qwen3.5:latest traegt unnoetigen Vision-Ballast (CLIP-Projector) fuer eine
reine Text-Kategorisierungsaufgabe. qwen3:8b ist kleiner (5,2 statt 6,6 GB)
und reines Textmodell. Code-Fallback in config.py, .env.example, README und
docs/MITGABE.md konsistent angepasst - HANDOFF.md bleibt unangetastet
(datierter Zeitpunkt-Stand, keine Anleitung).

Co-Authored-By: Claude Sonnet 5 <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_015vtvcyNkapuDh583643hNs
This commit is contained in:
Jeuner 2026-08-24 21:20:02 +02:00
parent 391eec5f41
commit 4109aee1bb
4 changed files with 6 additions and 6 deletions

View file

@ -14,7 +14,7 @@ WHISPER_COMPUTE=int8
# --- Kategorisierung (Ollama, lokal) ---
OLLAMA_URL=http://127.0.0.1:11434
OLLAMA_MODELL=qwen3.5:latest
OLLAMA_MODELL=qwen3:8b
# --- Nextcloud (leer lassen = nur lokale Ablage) ---
NEXTCLOUD_URL=

View file

@ -61,7 +61,7 @@ brew install ollama && ollama serve & # oder Ollama.app starten
**2. Sprachmodell** — ordnet die Anliegen ein:
```bash
ollama pull qwen3.5:latest # ~6,6 GB
ollama pull qwen3:8b # ~5,2 GB, reines Textmodell (kein Vision-Ballast)
```
Auf Rechnern mit 16 GB Arbeitsspeicher passt kein größeres Modell daneben,

View file

@ -11,7 +11,7 @@ die Reihenfolge, in der man prüft, ob es wirklich läuft.
|---|---|
| `.env` | aus `.env.example` kopieren, Werte eintragen (Abschnitt 3) |
| Whisper-Modell (~1,6 GB) | `~/whisper-models/ggml-large-v3-turbo.bin`, Download siehe README |
| Ollama-Modell (~6,6 GB) | `ollama pull qwen3.5:latest` |
| Ollama-Modell (~5,2 GB) | `ollama pull qwen3:8b` |
| Piper-Stimme | `~/piper-voices/…`, nur für die Ansage (Stufe 2) nötig |
| `ablage/`, `telefon/eingang/`, `dashboard.html` | Anruf- und Patientendaten, bleiben absichtlich lokal |
| FreeSWITCH-Konfiguration mit echtem SIP-Passwort | `telefon/freeswitch/einrichten.sh` schreibt sie aus der `.env` |
@ -27,7 +27,7 @@ die meiste Arbeit. Für einen ersten Durchlauf reicht:
```bash
brew install ffmpeg whisper-cpp
brew install ollama && ollama serve &
ollama pull qwen3.5:latest
ollama pull qwen3:8b
mkdir -p ~/whisper-models && cd ~/whisper-models
curl -LO https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-large-v3-turbo.bin
cd ~/praxis-telefon-agent && cp .env.example .env
@ -124,6 +124,6 @@ Wenn auf der anderen Seite etwas abweicht, sind vor allem diese Punkte für uns
hier interessant:
- andere Hardware/OS-Version und wie lange ein Anruf dann braucht (hier ~24 s),
- ob `qwen3.5:latest` bei 16 GB RAM neben laufender Telefonie noch passt,
- ob `qwen3:8b` bei 16 GB RAM neben laufender Telefonie noch passt,
- jede Stelle, an der README oder `.env.example` nicht gereicht haben — die
gehört dann dort hinein, nicht in diese Datei.

View file

@ -68,7 +68,7 @@ WHISPER_COMPUTE = os.environ.get("WHISPER_COMPUTE", "int8")
# --- Kategorisierung (Ollama, lokal) -----------------------------------------
OLLAMA_URL = os.environ.get("OLLAMA_URL", "http://127.0.0.1:11434")
OLLAMA_MODELL = os.environ.get("OLLAMA_MODELL", "qwen3.5:latest")
OLLAMA_MODELL = os.environ.get("OLLAMA_MODELL", "qwen3:8b")
PROMPT_DATEI = WURZEL / "prompts" / os.environ.get(
"PROMPT_DATEI", "categorize_de.txt"
)