Software · Anleitung · 20 Minuten

Ollama + Open WebUI —
in 20 Minuten live

März 2026 12 Min Lesezeit macOS + Linux

Was ist Ollama?

Ollama ist der einfachste Weg KI-Modelle lokal zu betreiben. Ein Befehl, ein Modell läuft. Kein Python-Setup, kein venv, keine CUDA-Treiber. Einfach installieren und los.

Im Hintergrund verwaltet Ollama alle Modelle, lädt sie bei Bedarf in den RAM und stellt eine REST-API bereit — auf die dann Open WebUI zugreift.

Was ist Open WebUI?

Open WebUI ist eine Browser-Oberfläche die identisch zu ChatGPT aussieht — nur läuft sie auf deinem Rechner. Konversationshistorie, Einstellungen, Modellwechsel — alles da. Komplett kostenlos, open source, keine Cloud.

Open WebUI läuft im Browser unter http://localhost:3000 — erreichbar von jedem Gerät im Heimnetz. Also auch vom Handy oder Laptop.

Schritt-für-Schritt-Anleitung

01

Ollama installieren

Terminal öffnen (Spotlight → Terminal) und einen Befehl eingeben:

# Ollama installieren (macOS)
curl -fsSL https://ollama.com/install.sh | sh

# Danach prüfen ob es läuft:
ollama --version
02

Erstes Modell herunterladen

Wir starten mit einem schnellen 7B-Modell zum Testen:

# Mistral 7B — ~4 GB, 2–3 Minuten Download
ollama pull mistral

# Direkt testen:
ollama run mistral
03

Docker installieren

Open WebUI läuft als Docker-Container. Docker Desktop von docker.com herunterladen und installieren. Einmalig, dann läuft es automatisch.

04

Open WebUI starten

Einen einzigen Befehl ausführen — danach nie wieder anfassen:

docker run -d -p 3000:8080
  --add-host=host.docker.internal:host-gateway
  -v open-webui:/app/backend/data
  --name open-webui
  --restart always
  ghcr.io/open-webui/open-webui:main
05

Im Browser öffnen

Browser öffnen, Adresse eingeben — fertig:

http://localhost:3000

# Vom Heimnetz (Handy/Laptop):
http://192.168.x.x:3000

Modelle herunterladen

Nach dem Setup empfehle ich diese Reihenfolge — je nach verfügbarem RAM:

ModellGrößeRAM nötigEmpfohlen für
ollama pull mistral4 GB8 GBEinstieg, schnell
ollama pull llama3.22 GB8 GBAllgemein, schnell
ollama pull qwen2.5:32b20 GB24 GBBeste Qualität
ollama pull deepseek-r1:14b9 GB16 GBReasoning, Logik
ollama pull qwen2.5-coder:7b4,5 GB8 GBCode schreiben

Autostart — läuft automatisch nach Neustart

Ollama startet auf dem Mac automatisch beim Login. Docker und der Open-WebUI-Container starten ebenfalls automatisch wenn Docker so konfiguriert ist. Du musst nichts tun — nach einem Neustart ist alles wieder da.

Tipp: Den Mac Mini nie ausschalten — einfach laufen lassen. Bei 20–30 Watt kostet das 2 € im Monat. Dafür ist deine KI immer sofort verfügbar.

Nächste Schritte

Du hast jetzt eine vollständige lokale KI-Umgebung. Was als nächstes?

  • Mikrofon anschließen + Whisper einrichten → Mikrofon-Guide
  • Modelle ausprobieren — qwen2.5:32b ist die erste Anlaufstelle für Qualität
  • Open WebUI Einstellungen erkunden — System-Prompts, Modellauswahl, History
  • Von Handy/Laptop im Heimnetz zugreifen über die IP-Adresse des Mac Mini

Modell-Rechner: Was läuft auf deiner Hardware?

Gib deinen verfügbaren RAM ein — und sieh sofort welche Modelle du nutzen kannst.

16 GB
Werbung

Die beste Hardware für dieses Setup

Ollama läuft auf dem Mac Mini M4 ohne Treiber, ohne Konfiguration, leise und stromsparend. 16 GB für 7B–14B-Modelle, 24 GB für 32B. Einmal kaufen, jahrelang nutzen.

Mac Mini M4 16 GB →* Testbericht lesen

* Affiliate-Link | Amazon-Partner | Preis ohne Gewähr

// Kurz erklärt — das Wichtigste
  • Ollama ist kostenlos und open-source — Installation auf dem Mac in unter 5 Minuten, kein Terminal-Wissen nötig
  • Erstes Modell laden mit einem Befehl: ollama pull qwen2.5:7b — das war's
  • Open WebUI ist eine lokale ChatGPT-Oberfläche, läuft im Browser auf localhost:3000, funktioniert auch vom Handy im WLAN
  • Ollama nutzt OLLAMA_HOST=0.0.0.0 um netzwerkweit erreichbar zu sein — kein Port ins Internet öffnen nötig
  • Mehrere Modelle parallel installieren ist möglich — ein 7B-Modell belegt ca. 4 GB, ein 32B-Modell ca. 20 GB Speicher
Mikrofon einrichten → Etwas klappt nicht?