Grout levert de inferentieservers mee en beheert ze voor je. Tekst, vision, beeldgeneratie, spraak en embeddings draaien allemaal lokaal met Metal- of CUDA-versnelling — en als je al Ollama draait of een OpenRouter-sleutel hebt, gebruikt Grout die ook.
Vijf inferentie-engines, één app, geen terminal.
Een llama.cpp-server draait gequantiseerde GGUF-modellen met Metal op Apple Silicon en CUDA op NVIDIA-hardware. Grout start, bewaakt en stopt hem voor je — er komt geen terminal aan te pas.
Vision-modellen laden samen met hun multimodale projector, zodat het lezen van een gefotografeerde pagina handschrift of het beschrijven van een diagram met dezelfde lokale runtime werkt.
Een stable-diffusion.cpp-server verzorgt lokale beeldgeneratie en -bewerking, met modelformaten die passen bij de machine waarop het geïnstalleerd is.
Parakeet spraak-naar-tekst, een end-of-utterance-model voor beurtdetectie, Silero voice activity detection en lokale tekst-naar-spraakstemmen.
Lokale embeddingmodellen voeden een vectorindex op schijf, en dat is wat semantisch zoeken in je eigen studieboeken en aantekeningen offline mogelijk maakt.
Wijs Grout aan een lokale Ollama-server om modellen die je al beheert te tonen, op te halen en ermee te chatten, in plaats van een tweede modelmap bij te houden.
Neem een OpenRouter-, OpenAI- of Together-sleutel mee wanneer je een frontier-cloudmodel wilt. Sleutels worden versleuteld op je machine bewaard en het verbruik wordt per project gerapporteerd.
Grout leest je RAM en GPU uit en beveelt modelformaten aan die daadwerkelijk draaien, in plaats van je iets te laten downloaden dat niet laadt.
De samengestelde catalogus in de app. Meer kun je via Ollama binnenhalen, en Premium-cloudmodellen zijn beschikbaar via Merits.
| Categorie | Modellen |
|---|---|
| Tekst | Qwen3.5 4B en 9B · Qwen3 4B · Gemma 4 12B en E4B · Llama 3.2 1B en 3B · DeepSeek-R1 Distill 8B · Phi-3.5 · Mistral |
| Vision | Qwen3-VL 2B, 4B en 8B · Gemma 4 E4B · InternVL3 1B · Kimi-VL A3B Thinking · MiniCPM-o 2.6 · SmolVLM 256M en Instruct · LFM2-VL 450M · Qwen2-VL 2B |
| Beeldgeneratie | FLUX.1 schnell · FLUX.2 Klein · Ideogram 4 · Stable Diffusion 2.1 · Bonsai Image 4B |
| Spraak | Parakeet TDT-CTC 110M, 0.6B en 1.1B · realtime end-of-utterance 120M · Silero VAD · lokale TTS-stemmen |
| Embeddings | EmbeddingGemma 300M · BGE small, base, large en M3 · nomic-embed-text · all-MiniLM-L6-v2 · multilingual-e5-large |
| Beeldhulpmiddelen | U²-Net achtergrondverwijdering · upscaling · AVIF-conversie |
Het eerlijke standpunt over lokale modellen is dat ze uitstekend zijn in het meeste van wat een student doet, en op één na de beste bij het zwaarste redeneerwerk. Een tool die in een van beide richtingen anders beweert, verkoopt je iets.
De opzet hier is dus een standaardinstelling en geen beperking. Lokale modellen doen het samenvatten, uitleggen, handschrift lezen, diagrammen en oefenvragen maken, kleine programma's en het dagelijkse schrijfwerk — meteen, gratis, offline. Wanneer een taak echt om een frontier-model vraagt, schaal je bewust op: Premium-modellen via Merits, of je eigen API-sleutel als je die al hebt.
Lokale AI draaien betekende tot nu toe een Python-omgeving, een CUDA-versie die niet klopte, een GGUF-bestand dat je op een forum vond en een terminalvenster. Dat is een prima hobby en een verschrikkelijk product. De engines zitten hier in de app, de modelcatalogus is samengesteld, en Grout leest je hardware uit om formaten aan te bevelen die daadwerkelijk laden.
De ontsnappingsroute blijft bestaan. Wijs het aan Ollama, voeg je eigen sleutels toe, wissel het model achter elke tool. Niets zit op slot.
Grout levert een samengestelde catalogus met tekst (Qwen3.5, Gemma 4, Llama 3.2, DeepSeek-R1-distills, Phi, Mistral), vision (Qwen3-VL, InternVL3, Kimi-VL, MiniCPM-o, SmolVLM), beeldgeneratie (FLUX.1 schnell, FLUX.2 Klein, Ideogram 4, Stable Diffusion 2.1), spraak (Parakeet, Silero VAD, lokale TTS) en embeddings (EmbeddingGemma, BGE, nomic-embed). Alles is gequantiseerd om op gewone laptops te draaien.
Nee. De inferentieservers zitten in de app en Grout beheert hun levenscyclus. Draai je al Ollama, dan kun je Grout daarnaartoe wijzen, maar dat is een gemak en geen vereiste.
Ja. Voeg een OpenRouter-, OpenAI- of Together-sleutel toe en die modellen verschijnen naast de lokale. Sleutels worden versleuteld op je machine bewaard, en verbruik en kosten worden per project gerapporteerd, zodat een gedeelde sleutel geen mysterieuze rekening wordt.
Ja, waar er een beschikbaar is. Metal wordt gebruikt op Apple Silicon en CUDA op ondersteunde NVIDIA-hardware, voor tekst, beeldgeneratie en spraak. Op een machine zonder beide draait alles nog steeds op de CPU met kleinere modellen.
Een klein tekstmodel is een paar honderd megabyte; een capabel 4-bits model in de range van 4 tot 9 miljard parameters is doorgaans twee tot zes gigabyte. Beeldmodellen zijn groter. Je downloadt alleen wat je kiest te gebruiken, en modellen kunnen worden verwijderd en later opnieuw opgehaald.
Quantisatie slaat modelgewichten op met verlaagde precisie — 4-bit of 8-bit in plaats van 16-bit — wat het geheugengebruik meerdere keren verkleint. Het kwaliteitsverlies is klein en bij de taken die studenten meebrengen meestal niet merkbaar. Het is dé techniek die maakt dat een capabel model op een schoollaptop past.
Gratis voor Windows en macOS. De inferentieservers zitten erbij — er valt verder niets te installeren.
Download Grout gratis