From 4109aee1bb28523c89d575a187fc33851b77ebfd Mon Sep 17 00:00:00 2001 From: Jeuner <62662523+Jeuners@users.noreply.github.com> Date: Mon, 24 Aug 2026 21:20:02 +0200 Subject: [PATCH] docs+fix: qwen3:8b als durchgaengigen Default statt qwen3.5:latest qwen3.5:latest traegt unnoetigen Vision-Ballast (CLIP-Projector) fuer eine reine Text-Kategorisierungsaufgabe. qwen3:8b ist kleiner (5,2 statt 6,6 GB) und reines Textmodell. Code-Fallback in config.py, .env.example, README und docs/MITGABE.md konsistent angepasst - HANDOFF.md bleibt unangetastet (datierter Zeitpunkt-Stand, keine Anleitung). Co-Authored-By: Claude Sonnet 5 Claude-Session: https://claude.ai/code/session_015vtvcyNkapuDh583643hNs --- .env.example | 2 +- README.md | 2 +- docs/MITGABE.md | 6 +++--- pipe/config.py | 2 +- 4 files changed, 6 insertions(+), 6 deletions(-) diff --git a/.env.example b/.env.example index af40f13..340038c 100644 --- a/.env.example +++ b/.env.example @@ -14,7 +14,7 @@ WHISPER_COMPUTE=int8 # --- Kategorisierung (Ollama, lokal) --- OLLAMA_URL=http://127.0.0.1:11434 -OLLAMA_MODELL=qwen3.5:latest +OLLAMA_MODELL=qwen3:8b # --- Nextcloud (leer lassen = nur lokale Ablage) --- NEXTCLOUD_URL= diff --git a/README.md b/README.md index d501ac8..15a2eff 100644 --- a/README.md +++ b/README.md @@ -61,7 +61,7 @@ brew install ollama && ollama serve & # oder Ollama.app starten **2. Sprachmodell** — ordnet die Anliegen ein: ```bash -ollama pull qwen3.5:latest # ~6,6 GB +ollama pull qwen3:8b # ~5,2 GB, reines Textmodell (kein Vision-Ballast) ``` Auf Rechnern mit 16 GB Arbeitsspeicher passt kein größeres Modell daneben, diff --git a/docs/MITGABE.md b/docs/MITGABE.md index da08815..cc7753f 100644 --- a/docs/MITGABE.md +++ b/docs/MITGABE.md @@ -11,7 +11,7 @@ die Reihenfolge, in der man prüft, ob es wirklich läuft. |---|---| | `.env` | aus `.env.example` kopieren, Werte eintragen (Abschnitt 3) | | Whisper-Modell (~1,6 GB) | `~/whisper-models/ggml-large-v3-turbo.bin`, Download siehe README | -| Ollama-Modell (~6,6 GB) | `ollama pull qwen3.5:latest` | +| Ollama-Modell (~5,2 GB) | `ollama pull qwen3:8b` | | Piper-Stimme | `~/piper-voices/…`, nur für die Ansage (Stufe 2) nötig | | `ablage/`, `telefon/eingang/`, `dashboard.html` | Anruf- und Patientendaten, bleiben absichtlich lokal | | FreeSWITCH-Konfiguration mit echtem SIP-Passwort | `telefon/freeswitch/einrichten.sh` schreibt sie aus der `.env` | @@ -27,7 +27,7 @@ die meiste Arbeit. Für einen ersten Durchlauf reicht: ```bash brew install ffmpeg whisper-cpp brew install ollama && ollama serve & -ollama pull qwen3.5:latest +ollama pull qwen3:8b mkdir -p ~/whisper-models && cd ~/whisper-models curl -LO https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-large-v3-turbo.bin cd ~/praxis-telefon-agent && cp .env.example .env @@ -124,6 +124,6 @@ Wenn auf der anderen Seite etwas abweicht, sind vor allem diese Punkte für uns hier interessant: - andere Hardware/OS-Version und wie lange ein Anruf dann braucht (hier ~24 s), -- ob `qwen3.5:latest` bei 16 GB RAM neben laufender Telefonie noch passt, +- ob `qwen3:8b` bei 16 GB RAM neben laufender Telefonie noch passt, - jede Stelle, an der README oder `.env.example` nicht gereicht haben — die gehört dann dort hinein, nicht in diese Datei. diff --git a/pipe/config.py b/pipe/config.py index 670df4a..53664fb 100644 --- a/pipe/config.py +++ b/pipe/config.py @@ -68,7 +68,7 @@ WHISPER_COMPUTE = os.environ.get("WHISPER_COMPUTE", "int8") # --- Kategorisierung (Ollama, lokal) ----------------------------------------- OLLAMA_URL = os.environ.get("OLLAMA_URL", "http://127.0.0.1:11434") -OLLAMA_MODELL = os.environ.get("OLLAMA_MODELL", "qwen3.5:latest") +OLLAMA_MODELL = os.environ.get("OLLAMA_MODELL", "qwen3:8b") PROMPT_DATEI = WURZEL / "prompts" / os.environ.get( "PROMPT_DATEI", "categorize_de.txt" )