Spraakherkenning, beurtdetectie en tekst-naar-spraak draaien allemaal op je eigen machine. Stel je vraag hardop, krijg de uitleg terug gesproken en ga verder — met de wifi uit en zonder dat er audio de kamer verlaat.
Vier modellen die lokaal samenwerken: spraakherkenning, beurtdetectie, de tutor zelf en een stem.
Spraak-naar-tekst draait lokaal met Parakeet-modellen. Je stem wordt op je eigen machine getranscribeerd en er wordt geen audio naar een server gestuurd.
Een apart end-of-utterance-model bepaalt wanneer je bent uitgesproken, zodat een gesprek doorloopt in plaats van te wachten op een vaste pauze of een knop.
Silero VAD scheidt spraak van omgevingsgeluid, en dat is wat handsfree gebruik werkbaar maakt in een echt klaslokaal in plaats van in een stille studio.
De tutor praat terug met lokale stemmen. Kies een stem, en net als al het andere werkt het met het netwerk uit.
Bouw per vak een agent met een eigen systeemprompt en model. Een natuurkundetutor die afleidingen doorwerkt, gedraagt zich anders dan een taalpartner.
Agents zijn zo ingesteld dat ze een probleem samen met jou doorwerken. Dat is zowel betere didactiek als het gebruik van AI dat het beleid van je school vrijwel zeker toestaat.
Spreek in een taal die je leert en krijg correcties uitgelegd in plaats van stilzwijgend doorgevoerd, met meertalige modellen aan beide kanten.
Dezelfde spraak-engine zet een opgenomen les of interview om in tekst die je vervolgens kunt samenvatten of doorzoeken.
Een vraag typen is een kleine drempel, maar je betaalt hem elke keer opnieuw. Hij is hoog genoeg dat een student die vastloopt bij stap vier van een afleiding meestal blijft staren in plaats van het probleem in een tekstvak te beschrijven. Praten haalt die drempel weg, en het aantal gestelde vragen schiet omhoog.
Het verandert ook wat voor vraag er wordt gesteld. Getypte vragen zijn meestal welgevormd en definitief. Gesproken vragen zijn halfgevormd — en dat is precies de toestand waarin een student verkeert wanneer hulp het meest waard is.
Tekst is één ding. Een doorlopende audiostroom vanaf de tafel van een kind is iets anders, en het is het onderdeel waar ouders en functionarissen gegevensbescherming het hardst bezwaar tegen maken — met reden. Een spraakassistent in de cloud betekent dat er een microfoonstroom het gebouw verlaat.
Lokale spraakherkenning haalt die stroom weg. De audio wordt getranscribeerd op de machine waarop hij is opgenomen en wordt nooit verzonden, waardoor een lastig gesprek een kort gesprek wordt. Het betekent ook geen transcriptierekening per minuut, dus een student kan een uur praten zonder dat iemand op de meter let.
Ja. Grout draait spraak-naar-tekst, beurtdetectie en tekst-naar-spraak lokaal, naast een lokaal taalmodel, zodat je een gesproken gesprek met een vaktutor kunt voeren zonder netwerkverbinding. Er wordt nergens audio naartoe gestuurd.
Ja. Lokale tekst-naar-spraak leest de antwoorden van de tutor voor met een stem die jij kiest. Omdat de stemmen lokaal zijn, werkt dit offline en kost het niets per minuut.
Ja, overal in de studio. Voice activity detection en end-of-utterance-detectie zorgen ervoor dat je gewoon kunt praten in plaats van een knop ingedrukt te houden, wat uitmaakt als je handen op een werkblad liggen.
Het specifieke risico bij spraakassistenten is dat de spraak van een kind wordt opgenomen en naar een bedrijf gestuurd. Lokale verwerking haalt die overdracht weg — de audio wordt lokaal getranscribeerd en nooit geüpload. Daarnaast kunnen ouders en verzorgers de activiteit inzien en schermtijdlimieten instellen.
Ja. Elke agent heeft een eigen systeemprompt en model, dus je kunt een scheikundetutor instellen die staat op kloppende reactievergelijkingen en daarnaast een essaycoach die nooit tekst voor je schrijft.
De studio levert meertalige spraak- en taalmodellen mee, en de interface zelf draait in meerdere talen. De kwaliteit verschilt per taal — veelgesproken talen zijn merkbaar sterker dan zeldzame.
Gratis download voor Windows en macOS. Spraak erin, spraak eruit, niets geüpload.
Download Grout gratis