Een laptop kopen om AI lokaal te draaien: de complete uitleg
We hebben op de AI-categoriepagina een korte gids staan over VRAM, werkgeheugen en koeling. Die is bewust kort — een quick reference. Dit artikel is de lange versie, voor wie ook wil begrijpen waarom die dingen zo werken, en wat het je concreet gaat kosten. Geen marketingtaal, geen 40-punten-checklist — gewoon wat er echt toe doet als je een LLM op je eigen laptop wilt draaien in plaats van via een cloud-abonnement.
VRAM: de harde grens, en hoe je 'm berekent
VRAM is het geheugen op je videokaart, en het is de belangrijkste beperking bij lokale AI. Past een model niet in het VRAM, dan draait het niet — of alsnog, maar dan leent de laptop geheugen van je gewone RAM, en dat is meestal tien tot twintig keer trager. Een model 'quantizen' (comprimeren naar minder bits per gewicht) is de standaardmanier om een model kleiner te maken zonder het dom te maken. Bij de gangbare 4-bit-quantization reken je grofweg op 1GB VRAM per miljard parameters, plus een beetje overhead voor de context (het stuk tekst dat het model 'onthoudt' tijdens een gesprek). Een model van 8 miljard parameters (zoals Llama 3.1 8B) past dus comfortabel in 8GB VRAM. Bij 13-14 miljard reken je op 10-12GB. Bij 70 miljard zit je al snel op 40GB+ — en dat heeft geen enkele laptop-GPU. Dan kom je uit bij Apple's unified memory (zie hieronder) of gewoon de cloud.
Werkgeheugen: op Windows bijzaak, op een MacBook de hoofdzaak
Hier zit het grootste verschil tussen de twee platformen. Op een Windows-laptop met een losse NVIDIA-GPU draait het model in het VRAM, en is je gewone RAM (32GB is een redelijk minimum) vooral voor Windows zelf, je browser en de tools eromheen — Ollama, LM Studio, of wat je verder open hebt staan. Op een MacBook is er geen apart VRAM: het werkgeheugen is 'unified memory', gedeeld tussen processor en GPU. Dat betekent dat de hoeveelheid RAM in een MacBook direct bepaalt hoe groot een model kan zijn dat je kan draaien. De M5 Max-chip ondersteunt zelf tot 128GB unified memory — genoeg voor modellen die op geen enkele laptop-GPU passen — al verkoopt bol.com op dit moment alleen configuraties tot 48GB; voor meer moet je rechtstreeks bij Apple bestellen. Snelheid en capaciteit zijn hier twee losse dingen: een RTX 5070 Ti met 12GB VRAM draait een klein model sneller dan een MacBook, maar de MacBook kan een model draaien dat simpelweg niet in die 12GB past.
Koeling: waarom dit zwaarder is dan gamen
Bij gamen piekt je GPU-gebruik, met rustmomenten ertussen — een menu, een cutscene, een laadscherm. Bij het genereren van tekst met een lokaal model draait de GPU minutenlang onafgebroken op vol vermogen, zonder adempauze. Dat is een ander soort belasting, en een laptop die prima koelt tijdens gamen kan alsnog gaan throttlen bij langdurige AI-taken. Throttling betekent dat de GPU zichzelf vertraagt om niet oververhit te raken — je inference-snelheid kelder dan gewoon, midden in een taak. Let in de specificaties op het aantal ventilatoren en heatpipes, en reken op een dikker, zwaarder chassis als je dit serieus doet. Dunne ultrabooks met een 'ingebouwde' GPU lopen sneller tegen thermische limieten aan dan een steviger gaminglaptop-chassis, ook al hebben ze op papier dezelfde GPU.
Software: wat je er daadwerkelijk mee draait
Lokale AI draaien vereist geen programmeerwerk. Ollama en LM Studio zijn de twee populairste tools — beide zijn gratis, installeer je als een gewoon programma, en laten je een model downloaden en meteen chatten via een simpel scherm. Onder de motorkap draait vaak llama.cpp, de motor die het meeste zware werk doet. Voor wie meer wil: Open WebUI geeft er een ChatGPT-achtige interface bovenop. Geen van deze tools vereist dat je zelf iets programmeert — het is installeren, model downloaden, en klaar.
Wat kost het echt?
Reken globaal in drie tranches, gebaseerd op wat er nu op bol.com verkrijgbaar is. Instap (rond de €2.900-3.300): een RTX 5070 Ti met 12GB VRAM (Razer Blade 18, MSI Stealth A18 AI+) of een MacBook Pro 14" M5 Pro met 24GB unified memory — genoeg voor modellen tot een graad of 13-14 miljard parameters, comfortabel. Midden (rond de €4.900): de MacBook Pro 16" M5 Max met 36GB unified memory, waarmee je een stuk groter kan gaan zonder VRAM-limiet. Top (€5.200-5.500): RTX 5090-laptops met 64GB systeem-RAM (ASUS ProArt P16, ASUS ROG Strix SCAR 18) voor wie serieus met de grootste modellen wil schuiven. Er is geen instapoptie onder de €2.500 die dit serieus goed doet — dat is gewoon de realiteit van de huidige hardware, niet iets waar wij overheen praten.
RTX Spark: de vooruitblik, geen koopadvies
NVIDIA's RTX Spark-platform belooft tot 128GB unified memory in een compact formaat, met beloftes rond het draaien van modellen tot 120 miljard parameters. Dat klinkt aantrekkelijk, en verschillende fabrikanten (ASUS, Dell, HP, Lenovo, Microsoft, MSI) hebben aankondigingen gedaan. Maar: dit is nog niet leverbaar. Verwacht wordt najaar 2026. Tot die tijd is het een naam om in de gaten te houden, geen model om nu op te wachten als je vandaag iets nodig hebt.
Veelgemaakte fouten bij het kopen van een AI-laptop
Een paar dingen die regelmatig misgaan:
- Alleen naar VRAM kijken en de koeling negeren — een laptop met veel VRAM die na vijf minuten throttlet, is in de praktijk trager dan je vooraf verwacht.
- Denken dat 'geschikt voor gaming' hetzelfde is als 'geschikt voor AI' — een gaming-GPU met weinig VRAM (8GB) is prima voor games, maar een harde grens voor grotere modellen.
- Een MacBook kopen met te weinig RAM omdat 'Apple toch snel is' — snelheid en modelgrootte zijn twee losse dingen, en RAM bepaalt bij Apple de grootte.
- Wachten op RTX Spark zonder concreet zicht op wanneer je 'm echt kan kopen — een vooruitblik is geen leveringsdatum.
- Vergeten dat een dikke, zware laptop de prijs is die je betaalt voor goede koeling — een dun, licht model met dezelfde GPU-specificaties zal onder langdurige belasting eerder inleveren.