Grout embarque les serveurs d'inférence et les gère à votre place. Texte, vision, génération d'images, parole et embeddings tournent en local avec l'accélération Metal ou CUDA — et si vous utilisez déjà Ollama ou disposez d'une clé OpenRouter, il s'en sert aussi.
Cinq moteurs d'inférence, une application, aucun terminal.
Un serveur llama.cpp exécute des modèles GGUF quantifiés avec Metal sur Apple Silicon et CUDA sur matériel NVIDIA. Grout le démarre, le surveille et l'arrête pour vous : aucune étape en terminal.
Les modèles de vision se chargent avec leur projecteur multimodal : lire la photo d'une page manuscrite ou décrire un schéma passe par le même environnement d'exécution local.
Un serveur stable-diffusion.cpp assure la génération et la retouche d'images en local, avec des tailles de modèles choisies pour la machine sur laquelle il est installé.
Reconnaissance vocale Parakeet, modèle de fin d'énoncé pour la détection de tour de parole, détection d'activité vocale Silero, et voix de synthèse locales.
Des modèles d'embeddings locaux alimentent un index vectoriel sur disque : c'est ce qui rend possible la recherche sémantique hors ligne dans vos propres manuels et vos notes.
Pointez Grout vers un serveur Ollama local pour lister, récupérer et interroger les modèles que vous gérez déjà, au lieu d'entretenir un second dossier de modèles.
Apportez une clé OpenRouter, OpenAI ou Together quand vous voulez un modèle de pointe dans le cloud. Les clés sont stockées chiffrées sur votre machine et l'usage est reporté par projet.
Grout lit votre RAM et votre GPU puis recommande des tailles de modèles qui tourneront vraiment, plutôt que de vous laisser télécharger quelque chose qui ne se chargera pas.
Le catalogue sélectionné à l'intérieur de l'application. D'autres modèles peuvent être récupérés via Ollama, et les modèles Premium du cloud sont accessibles avec les Merits.
| Catégorie | Modèles |
|---|---|
| Texte | Qwen3.5 4B et 9B · Qwen3 4B · Gemma 4 12B et E4B · Llama 3.2 1B et 3B · DeepSeek-R1 Distill 8B · Phi-3.5 · Mistral |
| Vision | Qwen3-VL 2B, 4B et 8B · Gemma 4 E4B · InternVL3 1B · Kimi-VL A3B Thinking · MiniCPM-o 2.6 · SmolVLM 256M et Instruct · LFM2-VL 450M · Qwen2-VL 2B |
| Génération d'images | FLUX.1 schnell · FLUX.2 Klein · Ideogram 4 · Stable Diffusion 2.1 · Bonsai Image 4B |
| Parole | Parakeet TDT-CTC 110M, 0.6B et 1.1B · fin d'énoncé en temps réel 120M · Silero VAD · voix TTS locales |
| Embeddings | EmbeddingGemma 300M · BGE small, base, large et M3 · nomic-embed-text · all-MiniLM-L6-v2 · multilingual-e5-large |
| Utilitaires d'image | Suppression d'arrière-plan U²-Net · agrandissement · conversion AVIF |
La position honnête sur les modèles locaux : ils sont excellents pour la quasi-totalité de ce que fait un élève, et en deuxième position sur le raisonnement le plus difficile. Un outil qui prétend le contraire, dans un sens ou dans l'autre, cherche à vous vendre quelque chose.
L'arrangement retenu ici est donc un réglage par défaut, pas une restriction. Les modèles locaux prennent en charge le résumé, l'explication, la lecture d'écriture manuscrite, la production de schémas et de questions d'entraînement, les petits programmes et le travail d'écriture quotidien — instantanément, gratuitement, hors ligne. Quand une tâche justifie vraiment un modèle de pointe, vous montez d'un cran délibérément : modèles Premium via les Merits, ou votre propre clé d'API si vous en avez déjà une.
Faire tourner de l'IA en local a longtemps voulu dire un environnement Python, une version de CUDA incompatible, un fichier GGUF trouvé sur un forum et une fenêtre de terminal. C'est un excellent passe-temps et un très mauvais produit. Ici, les moteurs sont livrés dans l'application, le catalogue de modèles est sélectionné, et Grout lit votre matériel pour recommander des tailles qui se chargeront vraiment.
La porte de sortie reste ouverte. Pointez-le vers Ollama, ajoutez vos propres clés, changez le modèle derrière n'importe quel outil. Rien n'est verrouillé.
Grout est livré avec un catalogue sélectionné couvrant le texte (Qwen3.5, Gemma 4, Llama 3.2, distillations DeepSeek-R1, Phi, Mistral), la vision (Qwen3-VL, InternVL3, Kimi-VL, MiniCPM-o, SmolVLM), la génération d'images (FLUX.1 schnell, FLUX.2 Klein, Ideogram 4, Stable Diffusion 2.1), la parole (Parakeet, Silero VAD, TTS local) et les embeddings (EmbeddingGemma, BGE, nomic-embed). Tous sont quantifiés pour tourner sur des portables ordinaires.
Non. Les serveurs d'inférence sont livrés dans l'application et Grout gère leur cycle de vie. Si vous utilisez déjà Ollama, vous pouvez pointer Grout vers lui, mais c'est un confort, pas une obligation.
Oui. Ajoutez une clé OpenRouter, OpenAI ou Together et ces modèles apparaissent aux côtés des modèles locaux. Les clés sont stockées chiffrées sur votre machine, et l'usage comme le coût sont reportés par projet, pour qu'une clé partagée ne se transforme pas en facture mystère.
Oui, lorsqu'il y en a une. Metal est utilisé sur Apple Silicon et CUDA sur le matériel NVIDIA pris en charge, pour le texte, la génération d'images et la parole. Sur une machine sans l'un ni l'autre, tout fonctionne sur processeur avec des modèles plus petits.
Un petit modèle de texte fait quelques centaines de mégaoctets ; un bon modèle en 4 bits, entre 4 et 9 milliards de paramètres, pèse en général de deux à six gigaoctets. Les modèles d'images sont plus lourds. Vous ne téléchargez que ce que vous choisissez d'utiliser, et les modèles peuvent être supprimés puis retéléchargés plus tard.
La quantification stocke les poids d'un modèle en précision réduite — 4 bits ou 8 bits au lieu de 16 — ce qui divise l'usage mémoire par plusieurs. La perte de qualité est faible et, pour les tâches que les élèves apportent, généralement imperceptible. C'est la technique qui, à elle seule, permet à un modèle capable de tenir sur un portable scolaire.
Gratuit pour Windows et macOS. Les serveurs d'inférence sont inclus : il n'y a rien d'autre à installer.
Télécharger Grout gratuitement