Guide des paramètres de vision
Choisir un modèle de vision, régler les tokens maximum et la température, et tirer un texte propre d'une écriture peu soignée.
Dernière mise à jour — 25 août 2026
Choisir un modèle de vision
Un modèle de vision lit des images : une photo de notes manuscrites, une page imprimée, un schéma, un graphique.
Ce que font ici les modèles de vision
Les modèles de vision de Grout transforment des notes manuscrites en texte modifiable directement sur le canevas, et ces mêmes modèles répondent à des questions sur ce que montre une image. Des modèles des familles QWEN et Llama figurent parmi ceux disponibles.
En local ou dans le cloud
- Les modèles de vision locaux s'exécutent entièrement sur votre machine : rien de l'image n'en sort. C'est la voie à suivre pour les travaux d'élèves et les copies.
- Le module optionnel Nexus AI atteint plus de 300 modèles sur les GPU cloud de Grout quand vous en voulez un que votre machine ne peut pas porter. Il exige un compte, une connexion et des Merits, et l'image quitte la machine.
- Les gros modèles de vision lisent mieux une écriture peu soignée ; les petits répondent plus vite. Essayez d'abord le petit et ne montez que s'il échoue vraiment.
- Comparez la taille du modèle à votre mémoire libre avant de le télécharger : le guide de configuration requise donne les chiffres.
Tokens maximum et température
Deux réglages font l'essentiel du travail. Les deux se règlent mal d'une façon qui ressemble à un problème de modèle.
Tokens maximum
Les tokens maximum plafonnent la longueur de la réponse du modèle. Cela ne rend pas la réponse meilleure, seulement plus longue — et une réponse plus longue met proportionnellement plus de temps à être générée.
- Valeur par défaut : 500.
- Plage : 100 à 1000.
- 100–200 pour une étiquette courte, un chiffre isolé ou une réponse d'une ligne.
- 500 pour une explication normale, d'où la valeur par défaut.
- 800–1000 seulement quand vous voulez vraiment une explication longue et entièrement détaillée.
Température
La température règle la variation de formulation du modèle. Basse, elle est reproductible et littérale ; haute, elle est inventive — la dernière chose que vous voulez en transcrivant l'écriture de quelqu'un.
- Valeur par défaut : 0,7.
- Plage : 0,0 à 1,0.
- 0,0–0,3 pour lire du texte sur une page, extraire des chiffres ou corriger contre un corrigé.
- 0,3–0,5 pour une explication factuelle où la formulation peut respirer un peu.
- 0,7–0,9 pour le brainstorming, les reformulations et l'écriture créative.
Si la sortie s'éloigne de la page
Une transcription qui se lit bien mais ne correspond pas à la page vient presque toujours d'une température trop haute. Ramenez-la vers zéro avant d'accuser le modèle ou la photo.
Préparer l'image avant de demander
La plupart des échecs de vision relèvent de la photo, pas de la configuration. Corrigez d'abord l'image et vous toucherez rarement à un curseur.
Prendre une photo que le modèle peut lire
- Éclairez la page uniformément et gardez votre propre ombre à l'écart.
- Photographiez perpendiculairement à la page, pas de biais.
- Recadrez serré sur l'écriture pour que le modèle ne lise pas aussi votre bureau.
- Redressez une page tournée avant de l'analyser.
- Montez le contraste sur un crayon pâle plutôt que la température.
Les outils qui aident
Recadrer, faire pivoter, ajuster au canevas, ainsi que les réglages de luminosité et de contraste, se trouvent tous sur le canevas : vous pouvez nettoyer une image sur place et relancer l'analyse sans quitter le projet.
Les actions de vision
Trois façons de poser une question à une image.
Ce que vous pouvez demander
- Expliquer l'image — une description de ce qu'elle montre et de ce qu'elle semble signifier.
- Extraire les données — texte et chiffres tirés de l'image sous une forme modifiable.
- Prompt personnalisé — votre propre question sur l'image, avec vos mots.
Écrire un bon prompt d'image
Dites ce qu'est l'image et ce que vous voulez en retour. « Ceci est la photo d'une réponse manuscrite de physique d'un élève ; transcris-la exactement en gardant les retours à la ligne » bat « lis ça » à chaque fois. Enregistrez ceux qui marchent comme prompts personnalisés.
Trois configurations à enregistrer
Enregistrez-les comme configurations distinctes plutôt que de réajuster les mêmes curseurs à chaque changement de tâche.
Points de départ
- Transcription : le plus petit modèle de vision qui s'en sorte, température proche de 0,0, tokens maximum calibrés sur la page.
- Expliquer un schéma : un modèle de taille moyenne, température autour de 0,4, tokens maximum 500.
- Corriger une copie : température 0,0–0,2, tokens maximum 500, avec votre barème dans le prompt.
- Des idées à partir d'un croquis : température 0,7 ou plus, tokens maximum 500.
Changer une chose à la fois
Quand un résultat est faux, changez la photo, le prompt, la température ou le modèle — mais un seul par essai. En changer deux revient à ne rien apprendre du résultat.