Guía de ajustes de visión
Elegir un modelo de visión, fijar los tokens máximos y la temperatura, y sacar texto limpio de una escritura desordenada.
Última actualización — 25 de agosto de 2026
Elegir un modelo de visión
Un modelo de visión lee imágenes: una foto de apuntes manuscritos, una página impresa, un diagrama, un gráfico.
Qué hacen aquí los modelos de visión
Los modelos de visión de Grout convierten apuntes manuscritos en texto editable directamente en el lienzo, y esos mismos modelos responden preguntas sobre lo que muestra una imagen. Entre los disponibles están modelos de las familias QWEN y Llama.
Local o en la nube
- Los modelos de visión locales se ejecutan por completo en tu equipo, así que nada de la imagen sale de él. Esta es la vía para el trabajo del alumnado y para las hojas de respuestas.
- El módulo opcional Nexus AI llega a más de 300 modelos en las GPU en la nube de Grout cuando quieres uno que tu equipo no puede sostener. Requiere cuenta, conexión y Merits, y la imagen sale de la máquina.
- Los modelos de visión más grandes leen mejor la escritura desordenada; los pequeños responden más rápido. Prueba primero el pequeño y sube solo cuando falle de verdad.
- Compara el tamaño del modelo con tu memoria libre antes de descargarlo: la guía de requisitos del sistema tiene las cifras.
Tokens máximos y temperatura
Dos ajustes hacen casi todo el trabajo. Los dos son fáciles de dejar mal de una forma que parece un problema del modelo.
Tokens máximos
Los tokens máximos limitan la longitud de la respuesta del modelo. No hacen que la respuesta sea mejor, solo más larga, y una respuesta más larga tarda proporcionalmente más en generarse.
- Valor predeterminado: 500.
- Rango: de 100 a 1000.
- De 100 a 200 cuando quieres una etiqueta corta, una cifra suelta o una respuesta de una línea.
- 500 para una explicación normal, que es la razón de que sea el valor predeterminado.
- De 800 a 1000 solo cuando de verdad quieres una explicación larga y detallada.
Temperatura
La temperatura controla cuánto varía el modelo su redacción. Baja es repetible y literal; alta es inventiva, que es lo último que quieres al transcribir la letra de alguien.
- Valor predeterminado: 0,7.
- Rango: de 0,0 a 1,0.
- De 0,0 a 0,3 para leer texto de una página, extraer cifras o corregir con una plantilla.
- De 0,3 a 0,5 para explicaciones factuales donde la redacción puede respirar un poco.
- De 0,7 a 0,9 para lluvia de ideas, formulaciones alternativas y escritura creativa.
Si la salida se aleja de la página
Una transcripción que se lee con fluidez pero no coincide con la página casi siempre es una temperatura demasiado alta. Bájala hacia cero antes de culpar al modelo o a la fotografía.
Prepara la imagen antes de preguntar
La mayoría de los fallos de visión son de fotografía, no de configuración. Arregla la foto primero y rara vez tendrás que tocar un control.
Hacer una foto que el modelo pueda leer
- Ilumina la página de forma uniforme y mantén tu propia sombra fuera.
- Dispara en perpendicular a la página, no en ángulo.
- Recorta bien alrededor de la escritura para que el modelo no acabe leyendo también tu mesa.
- Endereza una página girada antes de analizarla.
- Sube el contraste del lápiz flojo en lugar de subir la temperatura.
Las herramientas que ayudan
Recortar, rotar, ajustar al lienzo y los ajustes de brillo y contraste están todos en el lienzo, así que puedes limpiar una imagen ahí mismo y volver a lanzar el análisis sin salir del proyecto.
Las acciones de visión
Tres formas de plantearle una pregunta a una imagen.
Qué puedes pedir
- Explicar imagen: una descripción de lo que muestra la imagen y de lo que parece significar.
- Extraer datos: texto y cifras sacados de la imagen como algo que puedes editar.
- Indicación personalizada: tu propia pregunta sobre la imagen, con tus palabras.
Escribir una buena indicación de imagen
Di qué es la imagen y qué quieres de vuelta. «Esta es la foto de la respuesta manuscrita de física de un estudiante; transcríbela con exactitud, conservando los saltos de línea» gana siempre a «lee esto». Guarda las que funcionen como indicaciones personalizadas para no reescribirlas la semana que viene.
Tres configuraciones que conviene guardar
Guárdalas como configuraciones separadas en lugar de reajustar los mismos controles cada vez que cambias de tarea.
Puntos de partida
- Transcripción: el modelo de visión más pequeño que se defienda, temperatura cercana a 0,0 y tokens máximos ajustados a la página.
- Explicar un diagrama: un modelo mediano, temperatura en torno a 0,4 y tokens máximos 500.
- Corregir una hoja de respuestas: temperatura de 0,0 a 0,2, tokens máximos 500 y tu plantilla de corrección dentro de la indicación.
- Ideas a partir de un boceto: temperatura de 0,7 o más y tokens máximos 500.
Cambiar una cosa cada vez
Cuando un resultado sea erróneo, cambia la fotografía, la indicación, la temperatura o el modelo, pero solo uno de ellos por intento. Cambiar dos significa que no aprendes nada del resultado.