Modelos de verdad,
en tu propio hardware.
Grout incluye los servidores de inferencia y los gestiona por ti. Texto, visión, generación de imágenes, voz y embeddings funcionan en el dispositivo con aceleración Metal o CUDA; y si ya usas Ollama o tienes una clave de OpenRouter, también los aprovecha.
Actualizado
Qué funciona en local
Cinco motores de inferencia, una app, sin terminal.
Generación de texto
Un servidor llama.cpp ejecuta modelos GGUF cuantizados con Metal en Apple Silicon y CUDA en hardware NVIDIA. Grout lo arranca, lo supervisa y lo detiene por ti: no hay ningún paso por terminal.
Visión
Los modelos de visión se cargan con su proyector multimodal, así que leer una página manuscrita fotografiada o describir un diagrama funciona con el mismo entorno local.
Generación de imágenes
Un servidor stable-diffusion.cpp se encarga de generar y editar imágenes en local, con tamaños de modelo elegidos según la máquina donde está instalado.
Voz
Reconocimiento de voz con Parakeet, un modelo de fin de intervención para detectar los turnos, detección de actividad de voz con Silero y voces de síntesis locales.
Embeddings y recuperación
Los modelos de embeddings locales alimentan un índice vectorial en disco, que es lo que hace posible la búsqueda semántica sin conexión sobre tus propios libros y apuntes.
Ollama, si ya lo usas
Apunta Grout a un servidor local de Ollama para listar, descargar y chatear con los modelos que ya gestionas, en lugar de mantener un segundo directorio de modelos.
Tus propias claves de API
Trae una clave de OpenRouter, OpenAI o Together cuando quieras un modelo de frontera en la nube. Las claves se guardan cifradas en tu máquina y el uso se informa por proyecto.
Valores por defecto según tu hardware
Grout lee tu RAM y tu GPU y recomienda tamaños de modelo que realmente van a funcionar, en vez de dejarte descargar algo que no se podrá cargar.
Catálogo de modelos
El catálogo curado que hay dentro de la app. Se pueden añadir más a través de Ollama, y los modelos Premium en la nube están disponibles mediante Merits.
| Categoría | Modelos |
|---|---|
| Texto | Qwen3.5 4B y 9B · Qwen3 4B · Gemma 4 12B y E4B · Llama 3.2 1B y 3B · DeepSeek-R1 Distill 8B · Phi-3.5 · Mistral |
| Visión | Qwen3-VL 2B, 4B y 8B · Gemma 4 E4B · InternVL3 1B · Kimi-VL A3B Thinking · MiniCPM-o 2.6 · SmolVLM 256M e Instruct · LFM2-VL 450M · Qwen2-VL 2B |
| Generación de imágenes | FLUX.1 schnell · FLUX.2 Klein · Ideogram 4 · Stable Diffusion 2.1 · Bonsai Image 4B |
| Voz | Parakeet TDT-CTC 110M, 0.6B y 1.1B · fin de intervención en tiempo real 120M · Silero VAD · voces TTS locales |
| Embeddings | EmbeddingGemma 300M · BGE small, base, large y M3 · nomic-embed-text · all-MiniLM-L6-v2 · multilingual-e5-large |
| Utilidades de imagen | Eliminación de fondo con U²-Net · escalado · conversión a AVIF |
Local primero, y la nube cuando se lo gana
La posición honesta sobre los modelos locales es que son excelentes en casi todo lo que hace un estudiante y segundos en el razonamiento más difícil. Una herramienta que finja lo contrario, en cualquiera de las dos direcciones, te está vendiendo algo.
Así que aquí lo local es un valor por defecto, no una restricción. Los modelos locales se ocupan de resumir, explicar, leer letra manuscrita, generar diagramas y preguntas de práctica, programas pequeños y la escritura del día a día: al instante, gratis y sin conexión. Cuando una tarea justifica de verdad un modelo de frontera, escalas de forma deliberada: modelos Premium mediante Merits, o tu propia clave de API si ya tienes una.
Por qué importa que los servidores vengan incluidos
Usar IA en local ha significado históricamente un entorno de Python, una versión de CUDA que no encaja, un archivo GGUF encontrado en un foro y una ventana de terminal. Eso es una afición estupenda y un producto pésimo. Aquí los motores viajan dentro de la app, el catálogo de modelos está curado y Grout lee tu hardware para recomendar tamaños que sí se van a cargar.
La salida de emergencia sigue ahí. Apúntalo a Ollama, añade tus propias claves, cambia el modelo detrás de cualquier herramienta. Nada está cerrado.
Preguntas frecuentes
¿Qué modelos de IA puedo ejecutar en local en mi ordenador?
Grout incluye un catálogo curado que cubre texto (Qwen3.5, Gemma 4, Llama 3.2, destilados de DeepSeek-R1, Phi, Mistral), visión (Qwen3-VL, InternVL3, Kimi-VL, MiniCPM-o, SmolVLM), generación de imágenes (FLUX.1 schnell, FLUX.2 Klein, Ideogram 4, Stable Diffusion 2.1), voz (Parakeet, Silero VAD, TTS local) y embeddings (EmbeddingGemma, BGE, nomic-embed). Todos están cuantizados para funcionar en portátiles corrientes.
¿Tengo que instalar llama.cpp u Ollama por mi cuenta?
No. Los servidores de inferencia vienen dentro de la app y Grout gestiona su ciclo de vida. Si ya usas Ollama puedes apuntar Grout a él, pero es una comodidad, no un requisito.
¿Puedo usar mi propia clave de API de OpenRouter u OpenAI?
Sí. Añade una clave de OpenRouter, OpenAI o Together y esos modelos aparecerán junto a los locales. Las claves se guardan cifradas en tu máquina, y el uso y el coste se informan por proyecto para que una clave compartida no acabe en una factura misteriosa.
¿Grout usa mi GPU?
Sí, siempre que haya una disponible. Se usa Metal en Apple Silicon y CUDA en hardware NVIDIA compatible, para texto, generación de imágenes y voz. En una máquina sin ninguna de las dos, todo sigue funcionando en CPU con modelos más pequeños.
¿Cuánto espacio en disco ocupan los modelos?
Un modelo de texto pequeño ocupa unos cientos de megabytes; un modelo capaz de 4 bits en el rango de 4 a 9 mil millones de parámetros suele ocupar entre dos y seis gigabytes. Los modelos de imagen son mayores. Solo descargas lo que decides usar, y los modelos se pueden borrar y volver a descargar más adelante.
¿Qué es la cuantización y perjudica la calidad?
La cuantización guarda los pesos del modelo con precisión reducida (4 u 8 bits en vez de 16), lo que reduce el uso de memoria varias veces. El coste en calidad es pequeño y, para las tareas que traen los estudiantes, normalmente no se nota. Es la única técnica que hace que un modelo capaz quepa en un portátil escolar.
Descarga el estudio y luego los modelos
Gratis para Windows y macOS. Los servidores de inferencia vienen incluidos: no hay nada más que instalar.
Descarga Grout gratis