Qwen3-8B lokaal draaien met llama.cpp: zo doe je dat op Linux
Wil je een krachtig AI-model draaien zonder dat je data de deur uit gaat, zonder maandelijkse API-kosten en gewoon op je eigen laptop? Dan is lokaal draaien de oplossing. In deze tutorial installeren we Qwen3-8B — een van de sterkste open gewichtsmodellen — met llama.cpp op Linux. Alles draait offline, op jouw hardware.
In deze gids gaan we:
- llama.cpp bouwen (de motor die het model draait)
- Qwen3-8B downloaden en direct chatten
- Een simpele
qwen-alias maken zodat je nooit meer de lange regel typt - Nederlandse antwoorden afdwingen en de denkmodus uitschakelen
Waarom lokaal draaien?
Drie redenen die er voor ondernemers en privacybewuste gebruikers toe doen:
- Privacy: je gesprekken verlaten je machine niet.
- Geen API-kosten: eenmaal geïnstalleerd, kost verder gebruik niets.
- Offline: werkt zonder internetverbinding, handig onderweg of op locatie.
Stap 1: llama.cpp bouwen
We beginnen met het bouwen van de engine uit de broncode. Zorg dat git, cmake en een C++-compiler aanwezig zijn.
cd ~
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release -j$(nproc)
Heb je een NVIDIA-GPU met CUDA, bouw dan met GPU-ondersteuning:
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)
Stap 2: Model downloaden en direct chatten
De nieuwe CLI downloadt het model zelf — geen losse Python-stap nodig:
cd ~/llama.cpp
./build/bin/llama cli -hf Qwen/Qwen3-8B-GGUF:Q4_K_M
Dit haalt automatisch het Q4_K_M-bestand (ongeveer 5 GB) op en start een interactieve chat.
Let op: de llama.cpp commandoregel is de afgelopen maanden flink veranderd. In de bron van deze tutorial wordt de unified llama-binary gebruikt (./build/bin/llama cli ...). Die syntax kan per versie verschillen van wat je in oudere handleidingen ziet. Controleer altijd de officiële documentatie op github.com/ggml-org/llama.cpp als een vlag niet wordt herkend.
Stap 3: Taal en denkmodus regelen
Qwen3 heeft standaard “thinking mode” aan (grijze denkblokken) en kiest soms zelf een andere taal dan Nederlands. De tutorial gebruikt hiervoor de vlag -rea off in combinatie met een systeemprompt:
./build/bin/llama cli -hf Qwen/Qwen3-8B-GGUF:Q4_K_M -sys "Antwoord altijd in het Nederlands." -rea off
Eerlijke kanttekening: de vlag -rea off is in deze tutorial als werkend aangegeven, maar staat niet in de officieel gedocumenteerde llama.cpp-opties. De denkmodus van Qwen3 regel je in recente versies vaak via de parameter enable_thinking in de chat-template of via model-specifieke opties. Test de exacte syntax altijd tegen de versie die je hebt gebouwd, en val terug op de officiële docs bij een foutmelding.
Stap 4: Alias maken
Zet eenmalig een alias in je .bashrc zodat je voortaan qwen typt:
echo "alias qwen='cd ~/llama.cpp && ./build/bin/llama cli -hf Qwen/Qwen3-8B-GGUF:Q4_K_M -sys \"Antwoord altijd in het Nederlands.\" -rea off'" >> ~/.bashrc
source ~/.bashrc
Werkt de alias niet in een al open venster? Voer source ~/.bashrc uit of open een nieuwe terminal.
Stap 5: Als server draaien (optioneel)
Wil je het model koppelen aan andere tools (bijvoorbeeld een OpenAI-compatibele interface), draai het dan als server:
cd ~/llama.cpp
./build/bin/llama serve -hf Qwen/Qwen3-8B-GGUF:Q4_K_M --host 127.0.0.1 --port 8080
Test met:
curl http://localhost:8080/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"messages":[{"role":"user","content":"Werkt dit?"}]}'
Voor permanente beschikbaarheid na een reboot zet je het als systemd-service (zie de bronhandleiding voor het volledige eenheidbestand).
Oude bestanden opruimen
Kwam je van een eerdere Qwen2.5-installatie, ruim die dan op:
ls -lh ~/models
rm -f ~/models/qwen2.5-7b-instruct-q4_k_m.gguf
Geleerde lessen
| Probleem | Oorzaak | Fix |
|---|---|---|
externally-managed-environment bij pip |
Systeem-Python is beschermd | Gebruik een venv: python3 -m venv hf-venv |
| 404 bij Qwen2.5-GGUF-repo | Bestandsnaam klopte niet | Gebruik de -hf-vlag van de llama-CLI |
error: invalid argument: -cnv |
Nieuwe unified CLI kent deze vlag niet | Laat -cnv weg |
error: invalid argument: --no-think |
Vlag bestaat niet | Gebruik de in de tutorial genoemde aanpak (-rea off) |
| Antwoord in Duits/Engels | Qwen3 raadt zelf de taal | Systeemprompt: -sys "Antwoord altijd in het Nederlands." |
Alias qwen niet gevonden |
Oude .bashrc nog geladen | source ~/.bashrc of nieuw venster |
Klaar om te starten?
Hiermee draai je een van de sterkste open AI-modellen volledig op je eigen machine — gratis, offline en in het Nederlands. De belangrijkste les: de llama.cpp commandoregel ontwikkelt snel mee. Houd de officiële repository en de Qwen-pagina op Hugging Face binnen handbereik voor de actuele vlaggen en modelnamen.
Meer AI-toepassingen voor je bedrijf? Mediadeboer helpt je op weg.





