Logo
Sprachmodus

Sprechen Sie mit einem Tutor,
der nie nach Hause telefoniert.

Spracherkennung, Sprecherwechsel-Erkennung und Sprachausgabe laufen alle auf Ihrem eigenen Rechner. Stellen Sie eine Frage laut, bekommen Sie eine Erklärung gesprochen zurück und machen Sie weiter — mit ausgeschaltetem WLAN und ohne dass Audio den Raum verlässt.

Was das Gespräch trägt

Vier Modelle arbeiten lokal zusammen: Spracherkennung, Sprecherwechsel-Erkennung, der Tutor selbst und eine Stimme.

Spracherkennung offline

Speech-to-Text läuft lokal mit Parakeet-Modellen. Ihre Stimme wird auf Ihrem eigenen Rechner transkribiert, und kein Audio wird zu einem Server gestreamt.

Sprecherwechsel in Echtzeit

Ein eigenes Modell für das Äußerungsende erkennt, wann Sie fertig gesprochen haben. So fließt ein Gespräch, statt auf eine feste Pause oder einen Tastendruck zu warten.

Voice Activity Detection

Silero VAD trennt Sprache von Raumgeräuschen. Genau das macht freihändige Nutzung in einem echten Klassenzimmer praktikabel und nicht nur in einem stillen Studio.

Lokale Sprachausgabe

Der Tutor antwortet mit Stimmen, die auf dem Gerät laufen. Stimme wählen — und wie alles andere funktioniert es mit abgeschaltetem Netz.

Tutoren, die Sie konfigurieren

Bauen Sie pro Fach einen Agenten mit eigenem System-Prompt und Modell. Ein Physiktutor, der Herleitungen durchgeht, verhält sich anders als ein Sprachpartner.

Erklärt, statt zu beantworten

Die Agenten sind darauf ausgelegt, ein Problem mit Ihnen durchzuarbeiten. Das ist zugleich die bessere Didaktik und der Einsatz von KI, den Ihre Schulordnung mit ziemlicher Sicherheit erlaubt.

Sprachpraxis

Sprechen Sie in einer Sprache, die Sie lernen, und bekommen Sie Korrekturen erklärt statt stillschweigend übernommen — mit mehrsprachigen Modellen auf beiden Seiten.

Transkription für den Unterricht

Dieselbe Sprach-Engine transkribiert eine aufgezeichnete Stunde oder ein Interview in Text, den Sie dann zusammenfassen oder durchsuchen können.

Warum Sprache der Modus ist, der genutzt wird

Eine Frage zu tippen ist eine kleine Abgabe, aber sie wird jedes Mal fällig. Sie reicht aus, dass ein Schüler, der bei Schritt vier einer Herleitung feststeckt, das Problem meist eher anstarrt, als es in ein Textfeld zu schreiben. Sprechen streicht diese Abgabe, und die Zahl der gestellten Fragen steigt deutlich.

Es ändert auch, welche Art von Frage gestellt wird. Getippte Fragen sind eher wohlgeformt und endgültig. Gesprochene Fragen sind halbfertig — und genau in diesem Zustand ist ein Schüler, wenn Hilfe am meisten nützt.

Warum lokal hier stärker zählt als irgendwo sonst

Text ist eine Sache. Ein durchgehender Audiostream vom Schreibtisch eines Kindes ist eine andere, und er ist der Teil, gegen den Eltern und Datenschutzbeauftragte am schärfsten protestieren — zu Recht. Ein Sprachassistent aus der Cloud bedeutet, dass ein Mikrofonsignal das Gebäude verlässt.

Spracherkennung auf dem Gerät streicht diesen Stream. Das Audio wird auf dem Rechner transkribiert, auf dem es aufgenommen wurde, und nie übertragen — aus einem schwierigen Gespräch wird damit ein kurzes. Es bedeutet außerdem keine Transkriptionsrechnung pro Minute: Ein Schüler kann eine Stunde lang reden, ohne dass jemand auf einen Zähler schaut.

Häufige Fragen

Gibt es einen KI-Sprachtutor, der offline funktioniert?+

Ja. Grout führt Speech-to-Text, Sprecherwechsel-Erkennung und Text-to-Speech lokal aus, dazu ein lokales Sprachmodell. Sie können also ein gesprochenes Gespräch mit einem Fachtutor führen, während die Verbindung getrennt ist. Es wird kein Audio irgendwohin gestreamt.

Spricht der KI-Tutor laut?+

Ja. Text-to-Speech auf dem Gerät liest die Antworten des Tutors mit einer Stimme Ihrer Wahl vor. Weil die Stimmen lokal sind, funktioniert das offline und kostet nichts pro Minute.

Kann ich Spracheingabe statt Tippen nutzen?+

Ja, überall im Studio. Voice Activity Detection und die Erkennung des Äußerungsendes bedeuten, dass Sie natürlich sprechen können, statt eine Taste zu halten — was zählt, wenn Ihre Hände auf einem Arbeitsblatt liegen.

Ist es sicher, wenn ein Kind mit einem KI-Tutor spricht?+

Das konkrete Risiko bei Sprachassistenten ist, dass die Stimme eines Kindes aufgezeichnet und an ein Unternehmen geschickt wird. Verarbeitung auf dem Gerät streicht diese Übertragung — das Audio wird lokal transkribiert und nie hochgeladen. Darüber hinaus können Erziehungsberechtigte die Aktivität einsehen und Bildschirmzeit begrenzen.

Kann ich einen Tutor für ein bestimmtes Fach anlegen?+

Ja. Jeder Agent hat seinen eigenen System-Prompt und sein eigenes Modell. Sie können also einen Chemietutor konfigurieren, der auf ausgeglichenen Gleichungen besteht, und daneben einen Aufsatz-Coach, der Ihnen nie Prosa schreibt.

Funktioniert Sprache auch in anderen Sprachen als Englisch?+

Das Studio bringt mehrsprachige Sprach- und Sprachverarbeitungsmodelle mit, und die Oberfläche selbst läuft in mehreren Sprachen. Die Qualität schwankt je nach Sprache — weit verbreitete Sprachen sind merklich stärker als seltene.

Fragen Sie laut

Kostenloser Download für Windows und macOS. Sprache rein, Sprache raus, nichts hochgeladen.

Grout kostenlos herunterladen