Grout incluye los servidores de inferencia y los gestiona por ti. Texto, visión, generación de imágenes, voz y embeddings funcionan en el dispositivo con aceleración Metal o CUDA; y si ya usas Ollama o tienes una clave de OpenRouter, también los aprovecha.
Cinco motores de inferencia, una app, sin terminal.
Un servidor llama.cpp ejecuta modelos GGUF cuantizados con Metal en Apple Silicon y CUDA en hardware NVIDIA. Grout lo arranca, lo supervisa y lo detiene por ti: no hay ningún paso por terminal.
Los modelos de visión se cargan con su proyector multimodal, así que leer una página manuscrita fotografiada o describir un diagrama funciona con el mismo entorno local.
Un servidor stable-diffusion.cpp se encarga de generar y editar imágenes en local, con tamaños de modelo elegidos según la máquina donde está instalado.
Reconocimiento de voz con Parakeet, un modelo de fin de intervención para detectar los turnos, detección de actividad de voz con Silero y voces de síntesis locales.
Los modelos de embeddings locales alimentan un índice vectorial en disco, que es lo que hace posible la búsqueda semántica sin conexión sobre tus propios libros y apuntes.
Apunta Grout a un servidor local de Ollama para listar, descargar y chatear con los modelos que ya gestionas, en lugar de mantener un segundo directorio de modelos.
Trae una clave de OpenRouter, OpenAI o Together cuando quieras un modelo de frontera en la nube. Las claves se guardan cifradas en tu máquina y el uso se informa por proyecto.
Grout lee tu RAM y tu GPU y recomienda tamaños de modelo que realmente van a funcionar, en vez de dejarte descargar algo que no se podrá cargar.
El catálogo curado que hay dentro de la app. Se pueden añadir más a través de Ollama, y los modelos Premium en la nube están disponibles mediante Merits.
| Categoría | Modelos |
|---|---|
| Texto | Qwen3.5 4B y 9B · Qwen3 4B · Gemma 4 12B y E4B · Llama 3.2 1B y 3B · DeepSeek-R1 Distill 8B · Phi-3.5 · Mistral |
| Visión | Qwen3-VL 2B, 4B y 8B · Gemma 4 E4B · InternVL3 1B · Kimi-VL A3B Thinking · MiniCPM-o 2.6 · SmolVLM 256M e Instruct · LFM2-VL 450M · Qwen2-VL 2B |
| Generación de imágenes | FLUX.1 schnell · FLUX.2 Klein · Ideogram 4 · Stable Diffusion 2.1 · Bonsai Image 4B |
| Voz | Parakeet TDT-CTC 110M, 0.6B y 1.1B · fin de intervención en tiempo real 120M · Silero VAD · voces TTS locales |
| Embeddings | EmbeddingGemma 300M · BGE small, base, large y M3 · nomic-embed-text · all-MiniLM-L6-v2 · multilingual-e5-large |
| Utilidades de imagen | Eliminación de fondo con U²-Net · escalado · conversión a AVIF |
La posición honesta sobre los modelos locales es que son excelentes en casi todo lo que hace un estudiante y segundos en el razonamiento más difícil. Una herramienta que finja lo contrario, en cualquiera de las dos direcciones, te está vendiendo algo.
Así que aquí lo local es un valor por defecto, no una restricción. Los modelos locales se ocupan de resumir, explicar, leer letra manuscrita, generar diagramas y preguntas de práctica, programas pequeños y la escritura del día a día: al instante, gratis y sin conexión. Cuando una tarea justifica de verdad un modelo de frontera, escalas de forma deliberada: modelos Premium mediante Merits, o tu propia clave de API si ya tienes una.
Usar IA en local ha significado históricamente un entorno de Python, una versión de CUDA que no encaja, un archivo GGUF encontrado en un foro y una ventana de terminal. Eso es una afición estupenda y un producto pésimo. Aquí los motores viajan dentro de la app, el catálogo de modelos está curado y Grout lee tu hardware para recomendar tamaños que sí se van a cargar.
La salida de emergencia sigue ahí. Apúntalo a Ollama, añade tus propias claves, cambia el modelo detrás de cualquier herramienta. Nada está cerrado.
Grout incluye un catálogo curado que cubre texto (Qwen3.5, Gemma 4, Llama 3.2, destilados de DeepSeek-R1, Phi, Mistral), visión (Qwen3-VL, InternVL3, Kimi-VL, MiniCPM-o, SmolVLM), generación de imágenes (FLUX.1 schnell, FLUX.2 Klein, Ideogram 4, Stable Diffusion 2.1), voz (Parakeet, Silero VAD, TTS local) y embeddings (EmbeddingGemma, BGE, nomic-embed). Todos están cuantizados para funcionar en portátiles corrientes.
No. Los servidores de inferencia vienen dentro de la app y Grout gestiona su ciclo de vida. Si ya usas Ollama puedes apuntar Grout a él, pero es una comodidad, no un requisito.
Sí. Añade una clave de OpenRouter, OpenAI o Together y esos modelos aparecerán junto a los locales. Las claves se guardan cifradas en tu máquina, y el uso y el coste se informan por proyecto para que una clave compartida no acabe en una factura misteriosa.
Sí, siempre que haya una disponible. Se usa Metal en Apple Silicon y CUDA en hardware NVIDIA compatible, para texto, generación de imágenes y voz. En una máquina sin ninguna de las dos, todo sigue funcionando en CPU con modelos más pequeños.
Un modelo de texto pequeño ocupa unos cientos de megabytes; un modelo capaz de 4 bits en el rango de 4 a 9 mil millones de parámetros suele ocupar entre dos y seis gigabytes. Los modelos de imagen son mayores. Solo descargas lo que decides usar, y los modelos se pueden borrar y volver a descargar más adelante.
La cuantización guarda los pesos del modelo con precisión reducida (4 u 8 bits en vez de 16), lo que reduce el uso de memoria varias veces. El coste en calidad es pequeño y, para las tareas que traen los estudiantes, normalmente no se nota. Es la única técnica que hace que un modelo capaz quepa en un portátil escolar.
Gratis para Windows y macOS. Los servidores de inferencia vienen incluidos: no hay nada más que instalar.
Descarga Grout gratis