Hilfe · Fehlersuche · Lösungen

Etwas klappt nicht?
Hier ist die Lösung.

12 häufige Probleme Schritt-für-Schritt Fixes Ollama · Docker · Modelle

Lokale KI ist mächtig — aber der Setup-Weg hat Stolperstellen. Hier sind die 12 häufigsten Probleme die uns und unseren Lesern begegnet sind, mit konkreten Schritten zur Lösung.

🦙Ollama-Probleme
🧠Modell lädt nicht
🐳Docker / WebUI
🐢Zu langsam
Häufigste Ursache: Ollama wurde installiert aber nicht gestartet, oder macOS hat den Start blockiert.
  1. 1

    App manuell starten: Finder → Programme → Ollama doppelklicken. Das Lama-Symbol erscheint in der Menüleiste.

  2. 2

    Wenn macOS blockiert: Systemeinstellungen → Datenschutz & Sicherheit → "Trotzdem öffnen" klicken.

  3. 3

    Terminal-Test: Nach dem Start prüfen ob Ollama läuft:

    ollama --version

    Wenn "command not found": Ollama wurde nicht korrekt installiert. Neu herunterladen von ollama.com.

  4. 4

    API prüfen: Im Browser öffnen — muss "Ollama is running" zeigen:

    open http://localhost:11434
✓ Wenn "Ollama is running" erscheint: alles korrekt.
Meist ein Netzwerkproblem oder unzureichender Speicherplatz. Modelle sind mehrere GB groß.
  1. 1

    Speicherplatz prüfen: Apple-Menü → Über diesen Mac → Speicher. Brauchst du mindestens 2× die Modellgröße als freien Speicher.

    df -h ~
  2. 2

    LAN statt WLAN: Große Downloads (7B = ~4 GB, 32B = ~20 GB) via WLAN können abbrechen. LAN-Kabel verwenden.

  3. 3

    Download fortsetzen: Ollama unterstützt Resume. Einfach Pull-Befehl erneut ausführen — lädt ab da wo er aufgehört hat:

    ollama pull qwen2.5:7b
  4. 4

    Modellname prüfen: Tippfehler im Modellnamen führen zu "model not found". Verfügbare Modelle auf ollama.com/library suchen.

Das Modell ist zu groß für den verfügbaren RAM. Faustregel: 7B braucht ~5 GB, 32B braucht ~20 GB Unified Memory.
  1. 1

    Kleineres Modell wählen: Bei 16 GB RAM maximal 14B-Modelle. Bei 24 GB: 32B möglich.

    ollama pull qwen2.5:7b
  2. 2

    Andere Apps schließen: Browser, Xcode, andere RAM-hungrige Apps beenden. Aktivitätsanzeige zeigt RAM-Nutzung.

  3. 3

    Quantisierung wählen: Q4-Modelle brauchen halb so viel RAM wie Q8. Standard-Pull lädt Q4:

    ollama pull qwen2.5:14b-instruct-q4_0
  4. 4

    Langfristig: Wenn 16 GB RAM regelmäßig zu wenig ist — 24 GB-Modell ist die Lösung. → Mac Mini M4 Guide

Häufigste Ursache: Ollama läuft nicht, oder der Docker-Container kann Ollama nicht erreichen.
  1. 1

    Ollama läuft? Menüleiste prüfen — Lama-Symbol muss sichtbar sein. Wenn nicht: Ollama starten.

  2. 2

    Docker läuft? Docker Desktop öffnen — "Engine running" muss grün angezeigt sein.

  3. 3

    Container neu starten:

    docker restart open-webui
  4. 4

    Container komplett neu erstellen (wenn Restart nicht hilft):

    docker rm -f open-webui
    docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

    Achtung: Deine Gesprächsverläufe bleiben erhalten (Volume open-webui bleibt bestehen).

  5. 5

    Verbindung manuell prüfen (Admin → Settings → Connections):

    http://host.docker.internal:11434
Port 3000 wird von einer anderen App genutzt (z.B. Node.js-App, anderer Docker-Container).
  1. 1

    Anderen Port verwenden (z.B. 3001):

    docker run -d -p 3001:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

    Dann über http://localhost:3001 öffnen.

  2. 2

    Wer nutzt Port 3000?

    lsof -i :3000

    Zeigt welcher Prozess Port 3000 belegt.

Wenn das Modell den RAM überläuft, weicht macOS auf SSD-Swap aus — das ist 100× langsamer als RAM-Betrieb.
  1. 1

    Aktivitätsanzeige prüfen: Öffne Aktivitätsanzeige → Reiter "Arbeitsspeicher" → "Speicherauslagerung" anzeigen. Wenn dieser Wert hoch ist: Swap-Problem.

  2. 2

    Kleineres Modell wählen: Ein 7B-Modell das komplett in RAM passt ist 10× schneller als ein 32B-Modell das auf Swap ausgelagert wird.

  3. 3

    Metal-GPU-Beschleunigung prüfen — sollte bei Apple Silicon automatisch aktiv sein:

    ollama ps

    Zeigt laufende Modelle. Wenn "100% GPU" angezeigt wird: Metal aktiv.

  4. 4

    Context-Länge reduzieren: Sehr lange Chats verlangsamen jede Antwort. Neuen Chat starten oder Kontext im System-Prompt kürzen.

Whisper läuft lokal — die Verarbeitungszeit hängt vom Modell und der Aufnahmelänge ab.
  1. 1

    Kleineres Whisper-Modell wählen: In Open WebUI Einstellungen → Audio → Whisper Modell. "tiny" oder "base" sind deutlich schneller (leicht ungenauer), "large" ist am genauesten.

  2. 2

    Kürzere Aufnahmen: Whisper verarbeitet immer die gesamte Aufnahme auf einmal. Kurze Sätze statt langer Monologe eingeben.

  3. 3

    Gutes Mikrofon hilft: Schlechte Tonqualität zwingt Whisper zu mehr Verarbeitungsaufwand. → Mikrofon-Empfehlungen

Ollama hört standardmäßig nur auf localhost. Für Netzwerkzugriff muss OLLAMA_HOST gesetzt werden.
  1. 1

    Umgebungsvariable setzen: Ollama in Menüleiste → Quit. Dann Terminal:

    launchctl setenv OLLAMA_HOST "0.0.0.0"

    Ollama neu starten.

  2. 2

    IP-Adresse des Mac Mini herausfinden:

    ipconfig getifaddr en0

    Gibt die lokale IP zurück (z.B. 192.168.1.100).

  3. 3

    Vom anderen Gerät testen: Browser öffnen und aufrufen:

    http://192.168.1.100:11434

    Muss "Ollama is running" zeigen.

  4. 4

    macOS Firewall prüfen: Systemeinstellungen → Netzwerk → Firewall → sicherstellen dass Ollama erlaubt ist.

Ollama wurde über die GUI installiert aber der CLI-Befehl ist nicht im PATH.
  1. 1

    CLI-Tool installieren: Im Ollama-Menü (Lama-Symbol klicken) nach "Install command line tools" suchen und ausführen.

  2. 2

    PATH manuell prüfen:

    ls /usr/local/bin/ollama

    Wenn Datei nicht existiert: manuell verlinken:

    sudo ln -s /Applications/Ollama.app/Contents/Resources/ollama /usr/local/bin/ollama
  3. 3

    Terminal neu starten oder neuen Tab öffnen nach dem Symlink.

Viele Modelle bevorzugen Englisch wenn kein System-Prompt die Sprache vorgibt.
  1. 1

    System-Prompt setzen (in Open WebUI: Chat → System Prompt):

    Du bist ein hilfreicher Assistent. Antworte immer auf Deutsch, auch wenn die Frage auf Englisch gestellt wird.
  2. 2

    Modelfile erstellen mit deutschem Basis-Prompt:

    ollama create deutsch-qwen -f - <<EOF FROM qwen2.5:7b SYSTEM "Du bist ein hilfreicher Assistent. Antworte stets auf Deutsch." EOF
  3. 3

    Besseres deutsches Modell: Qwen2.5 hat ausgezeichnete Deutschkenntnisse — deutlich besser als Llama 3. → Modell-Ranking

Normal beim allerersten Start — Open WebUI lädt das Container-Image herunter (~1.5 GB). Danach startet es in Sekunden.
  1. 1

    Warten: Beim allerersten Start bis zu 5 Minuten warten. Docker Desktop zeigt den Download-Fortschritt.

  2. 2

    Logs beobachten während des Starts:

    docker logs -f open-webui

    Wenn "Application startup complete" erscheint: fertig, Browser neu laden.

✓ Nach dem ersten erfolgreichen Start: Open WebUI startet in 3–5 Sekunden.
Ollama hält das zuletzt genutzte Modell standardmäßig 5 Minuten im Speicher (Keep-Alive) für schnelle Folgeanfragen.
  1. 1

    Modell manuell entladen:

    ollama stop qwen2.5:7b
  2. 2

    Keep-Alive verkürzen (z.B. auf 1 Minute):

    launchctl setenv OLLAMA_KEEP_ALIVE "1m"
  3. 3

    Alle laufenden Modelle anzeigen:

    ollama ps

Immer noch ein Problem?

Das Ollama-Forum und der Discord sind sehr aktiv — die Community hilft schnell bei unbekannten Fehlern.

GitHub Issues → Ollama Discord → → FAQ lesen
Werbung

Weniger Probleme mit der richtigen Hardware

Die meisten Troubleshooting-Probleme entstehen durch zu wenig RAM. Mac Mini M4 mit 24 GB löst Out-of-Memory-Fehler dauerhaft — und läuft mit Ollama ohne Treiber-Chaos.

Mac Mini M4 16 GB →* Testbericht lesen

* Affiliate-Link | Amazon-Partner | Preis ohne Gewähr