Reconnaissance vocale, détection de tour de parole et synthèse vocale tournent toutes sur votre machine. Posez une question à voix haute, recevez une explication à l'oral, et continuez — le Wi-Fi coupé, sans qu'aucun son ne sorte de la pièce.
Quatre modèles qui coopèrent en local : la reconnaissance vocale, la détection de tour de parole, le tuteur lui-même et une voix.
La transcription de la parole tourne en local avec les modèles Parakeet. Votre voix est transcrite sur votre propre machine et aucun audio n'est diffusé vers un serveur.
Un modèle dédié de fin d'énoncé détermine quand vous avez fini de parler : la conversation s'enchaîne au lieu d'attendre une pause fixe ou l'appui sur un bouton.
Silero VAD sépare la parole du bruit ambiant, ce qui rend l'usage mains libres praticable dans une vraie salle de classe et pas seulement dans un studio silencieux.
Le tuteur répond à voix haute avec des voix locales. Choisissez une voix : comme tout le reste, cela fonctionne réseau coupé.
Créez un agent par matière, avec son propre prompt système et son propre modèle. Un tuteur de physique qui déroule des démonstrations ne se comporte pas comme un partenaire de conversation en langue.
Les agents sont conçus pour dérouler un problème avec vous. C'est à la fois une meilleure pédagogie et l'usage de l'IA que le règlement de votre établissement autorise presque à coup sûr.
Parlez dans la langue que vous apprenez et obtenez des corrections expliquées plutôt qu'appliquées en silence, avec des modèles multilingues des deux côtés.
Le même moteur vocal transcrit un cours enregistré ou un entretien en un texte que vous pouvez ensuite résumer ou parcourir.
Taper une question est une petite taxe, mais elle se paie à chaque fois. Elle suffit à ce qu'un élève bloqué à l'étape quatre d'une démonstration reste le plus souvent à fixer sa feuille plutôt que de décrire le problème dans un champ de texte. Parler supprime cette taxe, et le nombre de questions posées augmente nettement.
Cela change aussi la nature des questions. Les questions écrites tendent à être bien formulées et définitives. Les questions orales sont à moitié formées, ce qui correspond exactement à l'état dans lequel se trouve un élève au moment où l'aide serait la plus utile.
Le texte est une chose. Un flux audio continu depuis le bureau d'un enfant en est une autre, et c'est le point auquel les parents et les délégués à la protection des données s'opposent le plus fermement — à juste titre. Un assistant vocal dans le cloud, cela veut dire un flux de microphone qui sort de l'établissement.
La reconnaissance vocale locale supprime ce flux. L'audio est transcrit sur la machine qui l'a capté et n'est jamais transmis, ce qui transforme une conversation difficile en une conversation courte. Cela veut dire aussi aucune facture de transcription à la minute : un élève peut parler pendant une heure sans que personne ne regarde le compteur.
Oui. Grout exécute en local la transcription de la parole, la détection de tour de parole et la synthèse vocale, aux côtés d'un modèle de langue local : vous pouvez donc converser à voix haute avec un tuteur de matière sans connexion réseau. Aucun audio n'est diffusé nulle part.
Oui. La synthèse vocale locale lit les réponses du tuteur à voix haute, avec la voix de votre choix. Comme les voix sont locales, cela fonctionne hors ligne et sans coût à la minute.
Oui, partout dans le studio. La détection d'activité vocale et la détection de fin d'énoncé vous permettent de parler naturellement plutôt que de maintenir un bouton, ce qui compte quand vos mains sont sur une feuille d'exercices.
Le risque propre aux assistants vocaux est que la parole d'un enfant soit enregistrée et envoyée à une entreprise. Le traitement local supprime ce transfert : l'audio est transcrit sur place et n'est jamais envoyé. Au-delà de cela, les responsables légaux peuvent consulter l'activité et fixer des limites de temps d'écran.
Oui. Chaque agent a son propre prompt système et son propre modèle : vous pouvez configurer un tuteur de chimie qui exige des équations équilibrées et, à côté, un coach de rédaction qui n'écrit jamais de texte à votre place.
Le studio est livré avec des modèles de parole et de langue multilingues, et l'interface elle-même existe en plusieurs langues. La qualité varie selon la langue : les langues très parlées sont nettement meilleures que les langues rares.
Téléchargement gratuit pour Windows et macOS. La voix entre, la voix sort, rien n'est envoyé.
Télécharger Grout gratuitement