Zurück zum Hilfecenter

Anleitung zu den Vision-Einstellungen

Ein Vision-Modell wählen, Max Tokens und Temperatur setzen und sauberen Text aus unordentlicher Handschrift holen.

Zuletzt aktualisiert25. August 2026

Ein Vision-Modell wählen

Ein Vision-Modell liest Bilder: das Foto handschriftlicher Notizen, eine gedruckte Seite, ein Diagramm, ein Schaubild.

Was die Vision-Modelle hier leisten

Grouts Vision-Modelle verwandeln handschriftliche Notizen direkt auf der Arbeitsfläche in bearbeitbaren Text, und dieselben Modelle beantworten Fragen dazu, was ein Bild zeigt. Verfügbar sind unter anderem Modelle der Familien QWEN und Llama.

Lokal oder Cloud

  • Lokale Vision-Modelle laufen vollständig auf Ihrem Rechner, es verlässt also nichts vom Bild das Gerät. Das ist der Weg für Schülerarbeiten und Klausurbögen.
  • Das optionale Nexus-AI-Modul erreicht über 300 Modelle auf Grouts Cloud-GPUs, wenn Sie eines wollen, das Ihr Rechner nicht trägt. Es braucht ein Konto, eine Verbindung und Merits, und das Bild verlässt den Rechner.
  • Größere Vision-Modelle lesen unordentliche Handschrift besser, kleinere antworten schneller. Probieren Sie zuerst das kleine und wechseln Sie erst, wenn es wirklich scheitert.
  • Prüfen Sie die Modellgröße vor dem Download gegen Ihren freien Speicher — die Werte stehen in der Anleitung zu den Systemvoraussetzungen.

Max Tokens und Temperatur

Zwei Einstellungen erledigen den Großteil. Beide lassen sich so falsch setzen, dass es nach einem Modellproblem aussieht.

Max Tokens

Max Tokens begrenzt, wie lang die Antwort des Modells werden darf. Das macht sie nicht besser, nur länger — und eine längere Antwort braucht entsprechend länger.

  • Standard: 500.
  • Bereich: 100 bis 1000.
  • 100–200, wenn Sie eine kurze Beschriftung, eine einzelne Zahl oder eine einzeilige Antwort wollen.
  • 500 für eine normale Erklärung — deshalb ist es der Standard.
  • 800–1000 nur, wenn Sie wirklich eine lange, vollständig ausgeführte Erklärung möchten.

Temperatur

Die Temperatur steuert, wie stark das Modell seine Formulierungen variiert. Niedrig ist wiederholbar und wörtlich; hoch ist erfinderisch — das Letzte, was Sie beim Abtippen fremder Handschrift brauchen.

  • Standard: 0,7.
  • Bereich: 0,0 bis 1,0.
  • 0,0–0,3 zum Auslesen von Text, Herausziehen von Zahlen oder Korrigieren gegen einen Lösungsschlüssel.
  • 0,3–0,5 für sachliche Erklärungen, bei denen die Formulierung etwas atmen darf.
  • 0,7–0,9 für Ideensammlungen, alternative Formulierungen und kreatives Schreiben.

Wenn die Ausgabe von der Seite abdriftet

Eine Transkription, die flüssig klingt, aber nicht zur Seite passt, ist fast immer eine zu hoch gesetzte Temperatur. Ziehen Sie sie Richtung null, bevor Sie das Modell oder das Foto verantwortlich machen.

Das Bild vorbereiten, bevor Sie fragen

Die meisten Vision-Fehlschläge sind Fotografie, nicht Konfiguration. Bringen Sie zuerst das Bild in Ordnung, dann müssen Sie selten an einem Regler drehen.

Ein Foto, das das Modell lesen kann

  • Die Seite gleichmäßig ausleuchten und den eigenen Schatten fernhalten.
  • Frontal auf die Seite fotografieren, nicht schräg.
  • Eng auf die Schrift zuschneiden, damit das Modell nicht auch Ihren Schreibtisch liest.
  • Eine gedrehte Seite vor der Analyse gerade richten.
  • Bei blassem Bleistift den Kontrast anheben statt die Temperatur.

Die Werkzeuge, die helfen

Zuschneiden, Drehen, An Fläche anpassen sowie die Helligkeits- und Kontrastregler liegen alle auf der Arbeitsfläche. Sie können ein Bild also an Ort und Stelle aufräumen und die Analyse erneut starten, ohne das Projekt zu verlassen.

Die Vision-Aktionen

Drei Wege, einem Bild eine Frage zu stellen.

Was Sie verlangen können

  • Bild erklären — eine Beschreibung dessen, was das Bild zeigt und was es zu bedeuten scheint.
  • Daten extrahieren — Text und Zahlen aus dem Bild, als etwas Bearbeitbares.
  • Eigener Prompt — Ihre eigene Frage zum Bild, in Ihren Worten.

Einen guten Bild-Prompt schreiben

Sagen Sie, was das Bild ist und was Sie zurückhaben wollen. „Das ist ein Foto der handschriftlichen Physik-Antwort einer Schülerin; transkribiere sie exakt und behalte die Zeilenumbrüche bei“ schlägt „lies das“ jedes Mal. Speichern Sie, was funktioniert, als eigenen Prompt.

Drei Konfigurationen, die sich zu speichern lohnen

Speichern Sie diese als eigene Konfigurationen, statt bei jedem Aufgabenwechsel dieselben Regler neu zu justieren.

Ausgangspunkte

  • Transkription: das kleinste Vision-Modell, das damit zurechtkommt, Temperatur nahe 0,0, Max Tokens passend zur Seite.
  • Ein Diagramm erklären: ein mittelgroßes Modell, Temperatur um 0,4, Max Tokens 500.
  • Einen Klausurbogen korrigieren: Temperatur 0,0–0,2, Max Tokens 500 und Ihr Bewertungsschema im Prompt.
  • Ideen aus einer Skizze: Temperatur 0,7 oder höher, Max Tokens 500.

Immer nur eines ändern

Ist ein Ergebnis falsch, ändern Sie das Foto, den Prompt, die Temperatur oder das Modell — aber nur eines davon pro Versuch. Zwei Änderungen zugleich heißt, dass Sie aus dem Ergebnis nichts lernen.

Verwandte Anleitungen