Spracherkennung, Sprecherwechsel-Erkennung und Sprachausgabe laufen alle auf Ihrem eigenen Rechner. Stellen Sie eine Frage laut, bekommen Sie eine Erklärung gesprochen zurück und machen Sie weiter — mit ausgeschaltetem WLAN und ohne dass Audio den Raum verlässt.
Vier Modelle arbeiten lokal zusammen: Spracherkennung, Sprecherwechsel-Erkennung, der Tutor selbst und eine Stimme.
Speech-to-Text läuft lokal mit Parakeet-Modellen. Ihre Stimme wird auf Ihrem eigenen Rechner transkribiert, und kein Audio wird zu einem Server gestreamt.
Ein eigenes Modell für das Äußerungsende erkennt, wann Sie fertig gesprochen haben. So fließt ein Gespräch, statt auf eine feste Pause oder einen Tastendruck zu warten.
Silero VAD trennt Sprache von Raumgeräuschen. Genau das macht freihändige Nutzung in einem echten Klassenzimmer praktikabel und nicht nur in einem stillen Studio.
Der Tutor antwortet mit Stimmen, die auf dem Gerät laufen. Stimme wählen — und wie alles andere funktioniert es mit abgeschaltetem Netz.
Bauen Sie pro Fach einen Agenten mit eigenem System-Prompt und Modell. Ein Physiktutor, der Herleitungen durchgeht, verhält sich anders als ein Sprachpartner.
Die Agenten sind darauf ausgelegt, ein Problem mit Ihnen durchzuarbeiten. Das ist zugleich die bessere Didaktik und der Einsatz von KI, den Ihre Schulordnung mit ziemlicher Sicherheit erlaubt.
Sprechen Sie in einer Sprache, die Sie lernen, und bekommen Sie Korrekturen erklärt statt stillschweigend übernommen — mit mehrsprachigen Modellen auf beiden Seiten.
Dieselbe Sprach-Engine transkribiert eine aufgezeichnete Stunde oder ein Interview in Text, den Sie dann zusammenfassen oder durchsuchen können.
Eine Frage zu tippen ist eine kleine Abgabe, aber sie wird jedes Mal fällig. Sie reicht aus, dass ein Schüler, der bei Schritt vier einer Herleitung feststeckt, das Problem meist eher anstarrt, als es in ein Textfeld zu schreiben. Sprechen streicht diese Abgabe, und die Zahl der gestellten Fragen steigt deutlich.
Es ändert auch, welche Art von Frage gestellt wird. Getippte Fragen sind eher wohlgeformt und endgültig. Gesprochene Fragen sind halbfertig — und genau in diesem Zustand ist ein Schüler, wenn Hilfe am meisten nützt.
Text ist eine Sache. Ein durchgehender Audiostream vom Schreibtisch eines Kindes ist eine andere, und er ist der Teil, gegen den Eltern und Datenschutzbeauftragte am schärfsten protestieren — zu Recht. Ein Sprachassistent aus der Cloud bedeutet, dass ein Mikrofonsignal das Gebäude verlässt.
Spracherkennung auf dem Gerät streicht diesen Stream. Das Audio wird auf dem Rechner transkribiert, auf dem es aufgenommen wurde, und nie übertragen — aus einem schwierigen Gespräch wird damit ein kurzes. Es bedeutet außerdem keine Transkriptionsrechnung pro Minute: Ein Schüler kann eine Stunde lang reden, ohne dass jemand auf einen Zähler schaut.
Ja. Grout führt Speech-to-Text, Sprecherwechsel-Erkennung und Text-to-Speech lokal aus, dazu ein lokales Sprachmodell. Sie können also ein gesprochenes Gespräch mit einem Fachtutor führen, während die Verbindung getrennt ist. Es wird kein Audio irgendwohin gestreamt.
Ja. Text-to-Speech auf dem Gerät liest die Antworten des Tutors mit einer Stimme Ihrer Wahl vor. Weil die Stimmen lokal sind, funktioniert das offline und kostet nichts pro Minute.
Ja, überall im Studio. Voice Activity Detection und die Erkennung des Äußerungsendes bedeuten, dass Sie natürlich sprechen können, statt eine Taste zu halten — was zählt, wenn Ihre Hände auf einem Arbeitsblatt liegen.
Das konkrete Risiko bei Sprachassistenten ist, dass die Stimme eines Kindes aufgezeichnet und an ein Unternehmen geschickt wird. Verarbeitung auf dem Gerät streicht diese Übertragung — das Audio wird lokal transkribiert und nie hochgeladen. Darüber hinaus können Erziehungsberechtigte die Aktivität einsehen und Bildschirmzeit begrenzen.
Ja. Jeder Agent hat seinen eigenen System-Prompt und sein eigenes Modell. Sie können also einen Chemietutor konfigurieren, der auf ausgeglichenen Gleichungen besteht, und daneben einen Aufsatz-Coach, der Ihnen nie Prosa schreibt.
Das Studio bringt mehrsprachige Sprach- und Sprachverarbeitungsmodelle mit, und die Oberfläche selbst läuft in mehreren Sprachen. Die Qualität schwankt je nach Sprache — weit verbreitete Sprachen sind merklich stärker als seltene.
Kostenloser Download für Windows und macOS. Sprache rein, Sprache raus, nichts hochgeladen.
Grout kostenlos herunterladen