Logo
Bibliothèque de modèles

De vrais modèles,
sur votre propre matériel.

Grout embarque les serveurs d'inférence et les gère à votre place. Texte, vision, génération d'images, parole et embeddings tournent en local avec l'accélération Metal ou CUDA — et si vous utilisez déjà Ollama ou disposez d'une clé OpenRouter, il s'en sert aussi.

Ce qui tourne en local

Cinq moteurs d'inférence, une application, aucun terminal.

Génération de texte

Un serveur llama.cpp exécute des modèles GGUF quantifiés avec Metal sur Apple Silicon et CUDA sur matériel NVIDIA. Grout le démarre, le surveille et l'arrête pour vous : aucune étape en terminal.

Vision

Les modèles de vision se chargent avec leur projecteur multimodal : lire la photo d'une page manuscrite ou décrire un schéma passe par le même environnement d'exécution local.

Génération d'images

Un serveur stable-diffusion.cpp assure la génération et la retouche d'images en local, avec des tailles de modèles choisies pour la machine sur laquelle il est installé.

Parole

Reconnaissance vocale Parakeet, modèle de fin d'énoncé pour la détection de tour de parole, détection d'activité vocale Silero, et voix de synthèse locales.

Embeddings et recherche

Des modèles d'embeddings locaux alimentent un index vectoriel sur disque : c'est ce qui rend possible la recherche sémantique hors ligne dans vos propres manuels et vos notes.

Ollama, si vous l'utilisez déjà

Pointez Grout vers un serveur Ollama local pour lister, récupérer et interroger les modèles que vous gérez déjà, au lieu d'entretenir un second dossier de modèles.

Vos propres clés d'API

Apportez une clé OpenRouter, OpenAI ou Together quand vous voulez un modèle de pointe dans le cloud. Les clés sont stockées chiffrées sur votre machine et l'usage est reporté par projet.

Des réglages adaptés au matériel

Grout lit votre RAM et votre GPU puis recommande des tailles de modèles qui tourneront vraiment, plutôt que de vous laisser télécharger quelque chose qui ne se chargera pas.

Catalogue de modèles

Le catalogue sélectionné à l'intérieur de l'application. D'autres modèles peuvent être récupérés via Ollama, et les modèles Premium du cloud sont accessibles avec les Merits.

CatégorieModèles
TexteQwen3.5 4B et 9B · Qwen3 4B · Gemma 4 12B et E4B · Llama 3.2 1B et 3B · DeepSeek-R1 Distill 8B · Phi-3.5 · Mistral
VisionQwen3-VL 2B, 4B et 8B · Gemma 4 E4B · InternVL3 1B · Kimi-VL A3B Thinking · MiniCPM-o 2.6 · SmolVLM 256M et Instruct · LFM2-VL 450M · Qwen2-VL 2B
Génération d'imagesFLUX.1 schnell · FLUX.2 Klein · Ideogram 4 · Stable Diffusion 2.1 · Bonsai Image 4B
ParoleParakeet TDT-CTC 110M, 0.6B et 1.1B · fin d'énoncé en temps réel 120M · Silero VAD · voix TTS locales
EmbeddingsEmbeddingGemma 300M · BGE small, base, large et M3 · nomic-embed-text · all-MiniLM-L6-v2 · multilingual-e5-large
Utilitaires d'imageSuppression d'arrière-plan U²-Net · agrandissement · conversion AVIF

Le local d'abord, le cloud quand il le mérite

La position honnête sur les modèles locaux : ils sont excellents pour la quasi-totalité de ce que fait un élève, et en deuxième position sur le raisonnement le plus difficile. Un outil qui prétend le contraire, dans un sens ou dans l'autre, cherche à vous vendre quelque chose.

L'arrangement retenu ici est donc un réglage par défaut, pas une restriction. Les modèles locaux prennent en charge le résumé, l'explication, la lecture d'écriture manuscrite, la production de schémas et de questions d'entraînement, les petits programmes et le travail d'écriture quotidien — instantanément, gratuitement, hors ligne. Quand une tâche justifie vraiment un modèle de pointe, vous montez d'un cran délibérément : modèles Premium via les Merits, ou votre propre clé d'API si vous en avez déjà une.

Pourquoi il est important d'embarquer les serveurs

Faire tourner de l'IA en local a longtemps voulu dire un environnement Python, une version de CUDA incompatible, un fichier GGUF trouvé sur un forum et une fenêtre de terminal. C'est un excellent passe-temps et un très mauvais produit. Ici, les moteurs sont livrés dans l'application, le catalogue de modèles est sélectionné, et Grout lit votre matériel pour recommander des tailles qui se chargeront vraiment.

La porte de sortie reste ouverte. Pointez-le vers Ollama, ajoutez vos propres clés, changez le modèle derrière n'importe quel outil. Rien n'est verrouillé.

Questions fréquentes

Quels modèles d'IA peuvent tourner en local sur mon ordinateur ?+

Grout est livré avec un catalogue sélectionné couvrant le texte (Qwen3.5, Gemma 4, Llama 3.2, distillations DeepSeek-R1, Phi, Mistral), la vision (Qwen3-VL, InternVL3, Kimi-VL, MiniCPM-o, SmolVLM), la génération d'images (FLUX.1 schnell, FLUX.2 Klein, Ideogram 4, Stable Diffusion 2.1), la parole (Parakeet, Silero VAD, TTS local) et les embeddings (EmbeddingGemma, BGE, nomic-embed). Tous sont quantifiés pour tourner sur des portables ordinaires.

Dois-je installer llama.cpp ou Ollama moi-même ?+

Non. Les serveurs d'inférence sont livrés dans l'application et Grout gère leur cycle de vie. Si vous utilisez déjà Ollama, vous pouvez pointer Grout vers lui, mais c'est un confort, pas une obligation.

Puis-je utiliser ma propre clé d'API OpenRouter ou OpenAI ?+

Oui. Ajoutez une clé OpenRouter, OpenAI ou Together et ces modèles apparaissent aux côtés des modèles locaux. Les clés sont stockées chiffrées sur votre machine, et l'usage comme le coût sont reportés par projet, pour qu'une clé partagée ne se transforme pas en facture mystère.

Grout utilise-t-il ma carte graphique ?+

Oui, lorsqu'il y en a une. Metal est utilisé sur Apple Silicon et CUDA sur le matériel NVIDIA pris en charge, pour le texte, la génération d'images et la parole. Sur une machine sans l'un ni l'autre, tout fonctionne sur processeur avec des modèles plus petits.

Quel espace disque les modèles occupent-ils ?+

Un petit modèle de texte fait quelques centaines de mégaoctets ; un bon modèle en 4 bits, entre 4 et 9 milliards de paramètres, pèse en général de deux à six gigaoctets. Les modèles d'images sont plus lourds. Vous ne téléchargez que ce que vous choisissez d'utiliser, et les modèles peuvent être supprimés puis retéléchargés plus tard.

Qu'est-ce que la quantification et nuit-elle à la qualité ?+

La quantification stocke les poids d'un modèle en précision réduite — 4 bits ou 8 bits au lieu de 16 — ce qui divise l'usage mémoire par plusieurs. La perte de qualité est faible et, pour les tâches que les élèves apportent, généralement imperceptible. C'est la technique qui, à elle seule, permet à un modèle capable de tenir sur un portable scolaire.

Téléchargez le studio, puis les modèles

Gratuit pour Windows et macOS. Les serveurs d'inférence sont inclus : il n'y a rien d'autre à installer.

Télécharger Grout gratuitement