Qwen3-8B lokaal draaien met llama.cpp: zo doe je dat op Linux

Qwen3-8B lokaal draaien met llama.cpp: zo doe je dat op Linux

Wil je een krachtig AI-model draaien zonder dat je data de deur uit gaat, zonder maandelijkse API-kosten en gewoon op je eigen laptop? Dan is lokaal draaien de oplossing. In deze tutorial installeren we Qwen3-8B — een van de sterkste open gewichtsmodellen — met llama.cpp op Linux. Alles draait offline, op jouw hardware.

In deze gids gaan we:

  • llama.cpp bouwen (de motor die het model draait)
  • Qwen3-8B downloaden en direct chatten
  • Een simpele qwen-alias maken zodat je nooit meer de lange regel typt
  • Nederlandse antwoorden afdwingen en de denkmodus uitschakelen

Waarom lokaal draaien?

Drie redenen die er voor ondernemers en privacybewuste gebruikers toe doen:

  • Privacy: je gesprekken verlaten je machine niet.
  • Geen API-kosten: eenmaal geïnstalleerd, kost verder gebruik niets.
  • Offline: werkt zonder internetverbinding, handig onderweg of op locatie.

Stap 1: llama.cpp bouwen

We beginnen met het bouwen van de engine uit de broncode. Zorg dat git, cmake en een C++-compiler aanwezig zijn.

cd ~
git clone https://github.com/ggml-org/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build --config Release -j$(nproc)

Heb je een NVIDIA-GPU met CUDA, bouw dan met GPU-ondersteuning:

cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)

Stap 2: Model downloaden en direct chatten

De nieuwe CLI downloadt het model zelf — geen losse Python-stap nodig:

cd ~/llama.cpp
./build/bin/llama cli -hf Qwen/Qwen3-8B-GGUF:Q4_K_M

Dit haalt automatisch het Q4_K_M-bestand (ongeveer 5 GB) op en start een interactieve chat.

Let op: de llama.cpp commandoregel is de afgelopen maanden flink veranderd. In de bron van deze tutorial wordt de unified llama-binary gebruikt (./build/bin/llama cli ...). Die syntax kan per versie verschillen van wat je in oudere handleidingen ziet. Controleer altijd de officiële documentatie op github.com/ggml-org/llama.cpp als een vlag niet wordt herkend.

Stap 3: Taal en denkmodus regelen

Qwen3 heeft standaard “thinking mode” aan (grijze denkblokken) en kiest soms zelf een andere taal dan Nederlands. De tutorial gebruikt hiervoor de vlag -rea off in combinatie met een systeemprompt:

./build/bin/llama cli -hf Qwen/Qwen3-8B-GGUF:Q4_K_M -sys "Antwoord altijd in het Nederlands." -rea off

Eerlijke kanttekening: de vlag -rea off is in deze tutorial als werkend aangegeven, maar staat niet in de officieel gedocumenteerde llama.cpp-opties. De denkmodus van Qwen3 regel je in recente versies vaak via de parameter enable_thinking in de chat-template of via model-specifieke opties. Test de exacte syntax altijd tegen de versie die je hebt gebouwd, en val terug op de officiële docs bij een foutmelding.

Stap 4: Alias maken

Zet eenmalig een alias in je .bashrc zodat je voortaan qwen typt:

echo "alias qwen='cd ~/llama.cpp && ./build/bin/llama cli -hf Qwen/Qwen3-8B-GGUF:Q4_K_M -sys \"Antwoord altijd in het Nederlands.\" -rea off'" >> ~/.bashrc
source ~/.bashrc

Werkt de alias niet in een al open venster? Voer source ~/.bashrc uit of open een nieuwe terminal.

Stap 5: Als server draaien (optioneel)

Wil je het model koppelen aan andere tools (bijvoorbeeld een OpenAI-compatibele interface), draai het dan als server:

cd ~/llama.cpp
./build/bin/llama serve -hf Qwen/Qwen3-8B-GGUF:Q4_K_M --host 127.0.0.1 --port 8080

Test met:

curl http://localhost:8080/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"messages":[{"role":"user","content":"Werkt dit?"}]}'

Voor permanente beschikbaarheid na een reboot zet je het als systemd-service (zie de bronhandleiding voor het volledige eenheidbestand).

Oude bestanden opruimen

Kwam je van een eerdere Qwen2.5-installatie, ruim die dan op:

ls -lh ~/models
rm -f ~/models/qwen2.5-7b-instruct-q4_k_m.gguf

Geleerde lessen

Probleem Oorzaak Fix
externally-managed-environment bij pip Systeem-Python is beschermd Gebruik een venv: python3 -m venv hf-venv
404 bij Qwen2.5-GGUF-repo Bestandsnaam klopte niet Gebruik de -hf-vlag van de llama-CLI
error: invalid argument: -cnv Nieuwe unified CLI kent deze vlag niet Laat -cnv weg
error: invalid argument: --no-think Vlag bestaat niet Gebruik de in de tutorial genoemde aanpak (-rea off)
Antwoord in Duits/Engels Qwen3 raadt zelf de taal Systeemprompt: -sys "Antwoord altijd in het Nederlands."
Alias qwen niet gevonden Oude .bashrc nog geladen source ~/.bashrc of nieuw venster

Klaar om te starten?

Hiermee draai je een van de sterkste open AI-modellen volledig op je eigen machine — gratis, offline en in het Nederlands. De belangrijkste les: de llama.cpp commandoregel ontwikkelt snel mee. Houd de officiële repository en de Qwen-pagina op Hugging Face binnen handbereik voor de actuele vlaggen en modelnamen.

Meer AI-toepassingen voor je bedrijf? Mediadeboer helpt je op weg.

Ontdek hoe wij uw merk laten groeien.

Let's have a chat