diff --git a/.env.example b/.env.example index af40f13..340038c 100644 --- a/.env.example +++ b/.env.example @@ -14,7 +14,7 @@ WHISPER_COMPUTE=int8 # --- Kategorisierung (Ollama, lokal) --- OLLAMA_URL=http://127.0.0.1:11434 -OLLAMA_MODELL=qwen3.5:latest +OLLAMA_MODELL=qwen3:8b # --- Nextcloud (leer lassen = nur lokale Ablage) --- NEXTCLOUD_URL= diff --git a/README.md b/README.md index d501ac8..15a2eff 100644 --- a/README.md +++ b/README.md @@ -61,7 +61,7 @@ brew install ollama && ollama serve & # oder Ollama.app starten **2. Sprachmodell** — ordnet die Anliegen ein: ```bash -ollama pull qwen3.5:latest # ~6,6 GB +ollama pull qwen3:8b # ~5,2 GB, reines Textmodell (kein Vision-Ballast) ``` Auf Rechnern mit 16 GB Arbeitsspeicher passt kein größeres Modell daneben, diff --git a/docs/MITGABE.md b/docs/MITGABE.md index da08815..cc7753f 100644 --- a/docs/MITGABE.md +++ b/docs/MITGABE.md @@ -11,7 +11,7 @@ die Reihenfolge, in der man prüft, ob es wirklich läuft. |---|---| | `.env` | aus `.env.example` kopieren, Werte eintragen (Abschnitt 3) | | Whisper-Modell (~1,6 GB) | `~/whisper-models/ggml-large-v3-turbo.bin`, Download siehe README | -| Ollama-Modell (~6,6 GB) | `ollama pull qwen3.5:latest` | +| Ollama-Modell (~5,2 GB) | `ollama pull qwen3:8b` | | Piper-Stimme | `~/piper-voices/…`, nur für die Ansage (Stufe 2) nötig | | `ablage/`, `telefon/eingang/`, `dashboard.html` | Anruf- und Patientendaten, bleiben absichtlich lokal | | FreeSWITCH-Konfiguration mit echtem SIP-Passwort | `telefon/freeswitch/einrichten.sh` schreibt sie aus der `.env` | @@ -27,7 +27,7 @@ die meiste Arbeit. Für einen ersten Durchlauf reicht: ```bash brew install ffmpeg whisper-cpp brew install ollama && ollama serve & -ollama pull qwen3.5:latest +ollama pull qwen3:8b mkdir -p ~/whisper-models && cd ~/whisper-models curl -LO https://huggingface.co/ggerganov/whisper.cpp/resolve/main/ggml-large-v3-turbo.bin cd ~/praxis-telefon-agent && cp .env.example .env @@ -124,6 +124,6 @@ Wenn auf der anderen Seite etwas abweicht, sind vor allem diese Punkte für uns hier interessant: - andere Hardware/OS-Version und wie lange ein Anruf dann braucht (hier ~24 s), -- ob `qwen3.5:latest` bei 16 GB RAM neben laufender Telefonie noch passt, +- ob `qwen3:8b` bei 16 GB RAM neben laufender Telefonie noch passt, - jede Stelle, an der README oder `.env.example` nicht gereicht haben — die gehört dann dort hinein, nicht in diese Datei. diff --git a/pipe/config.py b/pipe/config.py index 670df4a..53664fb 100644 --- a/pipe/config.py +++ b/pipe/config.py @@ -68,7 +68,7 @@ WHISPER_COMPUTE = os.environ.get("WHISPER_COMPUTE", "int8") # --- Kategorisierung (Ollama, lokal) ----------------------------------------- OLLAMA_URL = os.environ.get("OLLAMA_URL", "http://127.0.0.1:11434") -OLLAMA_MODELL = os.environ.get("OLLAMA_MODELL", "qwen3.5:latest") +OLLAMA_MODELL = os.environ.get("OLLAMA_MODELL", "qwen3:8b") PROMPT_DATEI = WURZEL / "prompts" / os.environ.get( "PROMPT_DATEI", "categorize_de.txt" )