THE HUMAN LOOP

THE HUMAN LOOP

Play- & Promptbooks

Playbook: Lokale AI. Zet je wifi uit en het werkt door.

Je installeert één programma, je klantdossiers blijven in huis en na één opdracht weet je precies waar de grens ligt.

Avatar van THE HUMAN LOOP
THE HUMAN LOOP
jul 30, 2026
∙ Betaald
Header

Er ligt een map met dossiers waar je nooit iets van in ChatGPT plakt. Verslagen met namen erin, een personeelskwestie, de offertes van drie concurrenten. Je zou er graag doorheen laten zoeken en je doet het niet, want je weet niet waar het terechtkomt. Vanavond kun je op diezelfde laptop een model zetten dat die map leest terwijl je netwerkkabel eruit ligt. Het is één download van een paar gigabyte en er komt geen terminal aan te pas.

Een hand trekt de netwerkkabel uit een laptop terwijl op het scherm een antwoord gewoon doorloopt

Je draait waarschijnlijk al een lokaal model

In de editie van juni eindigde ik met een tip. Installeer LM Studio op de laptop die je al hebt en voel hoe ver je komt. Toen ging het over hardware die je zou kunnen kopen en nu neem ik de machine die er al staat. Waarom je dit zou willen, dat stond daar al, dus dat laat ik verder liggen.

Eigenlijk doe je het misschien al. Chrome installeert sinds 2024 op een deel van de machines Gemini Nano, een model van ongeveer vier gigabyte dat daar draait zonder dat iemand het merkt. Google heeft het nooit overal uitgerold, dus of het bij jou staat hangt af van je hardware. Lokale AI is in elk geval minder exotisch dan het klinkt.

Zo'n model is één bestand. Ik vergelijk het in workshops met een zipbestand waar heel veel tekst in geperst zit. Wat eruit komt is een gok over welk woord er nu volgt. Dat bestand van zeven gigabyte kan je vragen beantwoorden over het Romeinse Rijk, je offerte samenvatten en een mail herschrijven, zonder dat er een verbinding open hoeft te staan. De eerste keer dat je je wifi uitzet en het antwoord gewoon doorloopt, is het moment waarop het kwartje valt.

Ik moet daarbij een oude uitspraak van mezelf terugnemen. In het OpenClaw-playbook van maart schreef ik dat lokale modellen draaien een niche use case was. Vijf maanden later klopt dat al niet meer.

Twee programma's en waarom je met LM Studio begint

De twee namen die je tegenkomt zijn LM Studio en Ollama. De oude vuistregel dat de een voor gewone mensen is en de ander voor developers, die klopt niet meer, want Ollama heeft sinds vorig jaar ook een gewone app met een chatvenster waar je pdf's in kunt slepen. Ze kunnen allebei een servertje op je eigen machine draaien waar andere programma's op kunnen aansluiten.

Het verschil zit in wat je te zien krijgt vóór je downloadt. LM Studio schat in of een model op jouw machine past en welke variant je moet hebben. Het is de enige van de twee die dat inzicht in beeld brengt. Ollama staat onder een open-source licentie en heeft het rijkere ecosysteem eromheen. Daar kom ik hieronder op terug.

Voor ondernemers is er nog een praktische vraag die vaak fout wordt beantwoord, namelijk of je dit zakelijk mag inzetten. Dat mag, sinds vorig jaar zelfs zonder formulier of inkooptraject. Je gebruikt het binnen je eigen bedrijf voor je eigen werk, ook als je daar geld mee verdient. Wat niet mag is er een dienst omheen bouwen die je aan klanten verkoopt.

Whiteboard-schets met twee kaarten naast elkaar: LM Studio met een groen vinkje "past dit op jouw machine", Ollama met "open source, koppelt aan andere programma's"

Wat er past op de laptop die je al hebt

Je hoeft hier maar één ding van te snappen. Een model is een bestand en dat bestand moet passen in het werkgeheugen van je laptop, met genoeg ruimte over voor Windows en je browser. Hoeveel werkgeheugen je hebt zie je op een Windows-machine onder Systeem en op een Mac onder Over deze Mac.

Daarmee wordt de keuze simpel. Heb je acht gigabyte werkgeheugen, dan neem je een bestand van twee tot drie gigabyte. Op zestien gigabyte, de gangbare zakelijke laptop, kun je een bestand van zeven à acht gigabyte aan. Met tweeëndertig gigabyte kom je op een bestand van rond de zeventien en voelt het nauwelijks meer als een compromis. LM Studio rekent dit trouwens zelf voor je uit voordat je downloadt, dus je hoeft er niets van te onthouden.

In de modelnamen kom je een getal met een B tegen, zoals 4B of 12B. Die B staat voor miljard en is de ruwe maat voor hoe slim het model is. Hetzelfde model bestaat daarnaast in meerdere uitvoeringen, van fijn naar grof ingepakt, ongeveer zoals je een foto op hoge of lage kwaliteit opslaat. De standaarduitvoering heet Q4 en die pak je gewoon, want daarmee wordt het bestand fors kleiner terwijl je nauwelijks kwaliteit inlevert.

Vrijwel elke zakelijke laptop heeft geen aparte videokaart, alleen een chip die het beeld er even bij doet. Daar werkt het gewoon op, alleen merk je het verschil in snelheid. Een klein model typt sneller dan jij kunt lezen. Het model van twaalf miljard dat ik hieronder aanraad komt ongeveer op leestempo uit. Voor een mail of een samenvatting red je het daarmee, al ga je er niet de hele dag naast zitten wachten.

De echte vertraging zit in het begin. Zodra je een document in het venster plakt, moet het model dat eerst helemaal doorlezen voordat er ook maar één letter verschijnt. Op een oudere zakelijke laptop kan dat bij een stuk van een paar duizend woorden zo'n twintig seconden stilte opleveren, waar een machine met een zware videokaart er een halve seconde over doet. Ik heb dat zelf nagemeten door hetzelfde model twee keer te draaien op één machine, één keer met en één keer zonder videokaart. Het antwoord kwam vijf keer trager en het inlezen van het document zelfs tien keer. Tutorials typen "hoi" en meten dus het verkeerde.

Is je laptop verkocht als AI PC, reken dan niet op die aparte AI-chip die erin zit. Ollama en LM Studio spreken hem niet aan, dus hij ligt er werkloos bij. In de ene test die ik erover vond waarin die chip wel werd gebruikt, was hij zelfs langzamer dan de gewone processor.

Whiteboard-schets van de geheugenstaffel: 8 GB met een klein model, 16 GB met een middelgroot model, 32 GB met een groot model, met per trede de bestandsgrootte

Je eerste model, in een kwartier

Ga naar lmstudio.ai, download de versie voor jouw systeem en installeer hem zoals elk ander programma. Je hebt geen account nodig. Op een Mac moet het een Apple Silicon-machine zijn, want oudere Intel-Macs vallen af. Kom je op de site ook een app tegen die Bionic heet, dan is dat een nieuwere agent-variant die je voor nu kunt laten staan.

Klik daarna op Discover, het tabblad waar de modellen staan. Zoek op Gemma 4 12B en kijk naar de varianten. LM Studio schat vooraf in wat er in jouw geheugen past en waarschuwt je als een bestand te groot is, dus neem de grootste die zonder waarschuwing binnenkomt. Bij zestien gigabyte werkgeheugen is dat meestal de 4bit-variant van ongeveer zeven gigabyte. Klik op download en wacht.

Ga vervolgens naar Chat, laad het model en typ je eerste vraag. Zet dan je wifi uit en stel nog een vraag, want dat is de test die je zelf wilt zien.

De Discover-tab van LM Studio met Gemma 4 12B QAT geselecteerd, en rechts de downloadoptie met het bestand van 7,15 gigabyte

Twee instellingen verdienen aandacht en de rest laat je met rust.

Zet thinking uit voor gewoon werk. Modellen van deze generatie denken eerst hardop na voordat ze antwoorden. Ik heb dat opgemeten en het loopt hard op. Voor één korte zakelijke mail produceerde een model ruim vierduizend tekens denkwerk voordat er een letter van die mail verscheen. Bij een ander liep dat op tot elfduizend. Op een laptop zonder videokaart betekent dat al snel drie minuten stilte voordat de eerste letter komt. De schakelaar zit in het chatvenster zelf. Zet hem uit voor schrijven, samenvatten en zoeken. Aanzetten doe je alleen bij ingewikkeld werk.

Zet het contextvenster hoog genoeg. Dat venster is hoeveel tekst het model in één gesprek kan overzien. Het verklaart waarschijnlijk het merendeel van alle teleurstellingen met lokale modellen. Standaard past er ongeveer vier- tot vijfduizend Nederlandse woorden in. Bij Ollama is dat nog de helft daarvan. Plak je een langer stuk, dan valt het begin eruit en lijkt het model dom terwijl het die tekst nooit heeft gezien. Zet het hoger zodra je met documenten werkt. Het kost je wel geheugen.

Wat drie modellen deden met één Nederlandse offerte

Kleine modellen zijn de afgelopen twee jaar hard vooruitgegaan. Qwen3.5 4B is een bestand van 3,4 gigabyte dat op een laptop zonder videokaart draait. Op een veelgebruikte redeneertest met vragen op promovendus-niveau scoort het zesenzeventig procent. Diezelfde test kwam eind 2023 uit en GPT-4 haalde er toen negenendertig op. Twee kanttekeningen horen erbij. De modellen van nu scoren met thinking aan, precies de stand die ik je hierboven aanraad uit te zetten. Daarnaast lekken zulke testvragen na verloop van tijd de trainingsdata in. Het blijft een formaat dat twee jaar geleden speelgoed heette.

Toch is er een grens en die wilde ik zelf zien. Er bestaat namelijk geen enkele vergelijkende test van de huidige generatie kleine modellen op Nederlands. De Gemeente Amsterdam doet met het Ministerie van BZK wel zulk onderzoek en voert het volledig in het Nederlands uit, maar op een oudere lichting modellen. GEITje, het bekendste Nederlandse open model, is op verzoek van Stichting BREIN offline gehaald en GPT-NL kun je nog niet downloaden. Beide kwamen in de editie over Nederlandse AI al langs. Dus heb ik drie modellen naast elkaar gezet met een verzonnen Nederlandse offerte waarin ik de feiten zelf had vastgelegd, plus een paar opdrachten daarover.

Feiten terugvinden ging bij alle drie foutloos. De opzegtermijn van drie maanden kwam er elke keer correct uit. Samenvatten ging bij twee van de drie prima, inclusief de prijs, de looptijd en de uitzonderingen buiten scope. Het derde model kwam bij die opdracht helemaal niet aan een antwoord toe, omdat het zijn hele budget in het denkspoor stak.

Zelf Nederlands schrijven is een ander verhaal. Het kleinste model, drie miljard parameters, opende een zakelijke mail met "Lieve" en schreef verderop dat het aannam dat alles "naar jouw zake past", waarbij het binnen dezelfde mail wisselde tussen je en u. Het middelste model bleef begrijpelijk maar vroeg of de offerte "nog bezwaar had". Het model van twaalf miljard leverde een mail op die je zo kon versturen. Lezen doen ze alle drie goed. Zodra ze zelf vrije tekst moeten opstellen, wordt het formaat zichtbaar.

De offerte in het chatvenster van LM Studio, met bovenaan de instructie om alleen op basis van het document te antwoorden en niets te verzinnen

In die offerte staat nergens een garantietermijn en daar heb ik twaalf keer per model naar gevraagd. Het kleinste model verzon drie van de twaalf keer een concrete termijn. Twaalf maanden, dertig dagen en drie jaar, alle drie met evenveel stelligheid opgeschreven. Nog eens drie keer presenteerde het het beheercontract als antwoord op een vraag over garantie. Bij een offertevergelijking is dat het soort fout waar je pas achter komt als het te laat is.

Daarna voegde ik één zin toe aan de instructie. Staat het antwoord er niet in, zeg dat dan en verzin niets. Datzelfde model gaf toen twaalf van de twaalf keer netjes aan dat de garantietermijn er niet in stond. Het grotere model deed dat overigens al uit zichzelf.

Die ene zin kost je vijf seconden en hij haalt het gokken eruit. Ik doe in workshops de vergelijking met de rails die je bij het bowlen omhoog zet voor je kinderen. De bal kan er dan niet meer naast, hoe hard je kind ook gooit.

Zwaar denkwerk laat een klein model op je laptop liggen. Binnen de Gemma 4-familie zakt de kleinste variant op een wiskundetest met veel tussenstappen naar tweeënveertig procent waar de grootste op negenentachtig zit, terwijl het verschil op een brede kennistest maar acht punten is. Hoe meer stappen een taak op elkaar stapelt, hoe harder het formaat aankomt. Actuele feiten kent het model ook niet, want zijn hele kennis zit in dat ene bestand van de dag dat het gemaakt werd.

Hieronder maak je er een werkende opzet van. Welk model je op jouw machine downloadt, met de exacte naam die je intypt, per geheugenmaat. De vier zinnen die van elke opdracht een betrouwbare opdracht maken. Hoe je je eigen documenten erbij haalt zonder dat het antwoord stilletjes verzint. Waarom bij de tweede route, Ollama, één woord van vijf letters genoeg is om je data alsnog de deur uit te sturen. En wat de Autoriteit Persoonsgegevens hier in juli over publiceerde, inclusief de stap die voor jou vervalt en de zes die blijven staan. Dit is het deel dat ik normaal in trainingen bij organisaties doorloop.

Maandelijks opzegbaar en je eerste playbook is gratis.

Avatar van User

Lees deze post gratis verder, aangeboden door THE HUMAN LOOP.

Of koop een betaald abonnement
© 2026 Luciano Currie · Privacy ∙ Voorwaarden ∙ Incassomelding
Begin je SubstackDownload de App
Substack is de plek voor geweldige cultuur