El reconocimiento de voz, la detección de turnos y la síntesis de voz funcionan en tu propio ordenador. Haz una pregunta en voz alta, recibe la explicación hablada y sigue adelante, con el wifi apagado y sin que salga ningún audio de la sala.
Cuatro modelos cooperando en el dispositivo: reconocimiento de voz, detección de turnos, el propio tutor y una voz.
La conversión de voz a texto se ejecuta en el dispositivo con modelos Parakeet. Tu voz se transcribe en tu propia máquina y no se transmite ningún audio a un servidor.
Un modelo específico de fin de intervención decide cuándo has terminado de hablar, así que la conversación fluye en lugar de esperar una pausa fija o que pulses un botón.
Silero VAD separa el habla del ruido de la sala, que es lo que hace viable el uso con las manos libres en un aula real y no en un estudio en silencio.
El tutor responde en voz alta con voces que corren en el dispositivo. Elige una voz y funcionará con la red apagada, como todo lo demás.
Crea un agente por asignatura con su propio prompt de sistema y su propio modelo. Un tutor de física que desarrolla demostraciones se comporta distinto a un compañero de conversación de idiomas.
Los agentes están configurados para resolver el problema contigo. Eso es a la vez mejor pedagogía y el uso de la IA que la normativa de tu centro casi con seguridad permite.
Habla en el idioma que estás aprendiendo y recibe las correcciones explicadas en vez de aplicadas en silencio, con modelos multilingües atendiendo ambos lados.
El mismo motor de voz transcribe una clase grabada o una entrevista a texto que luego puedes resumir o buscar.
Escribir una pregunta es un peaje pequeño, pero se cobra cada vez. Basta para que un estudiante atascado en el paso cuatro de una demostración se quede mirándola en lugar de describir el problema en un cuadro de texto. Hablar elimina ese peaje, y el número de preguntas sube mucho.
También cambia el tipo de pregunta. Las preguntas escritas tienden a estar bien formuladas y cerradas. Las habladas están a medio formar, que es justo el estado en el que está un estudiante cuando la ayuda le sería más útil.
El texto es una cosa. Un flujo continuo de audio desde el pupitre de un menor es otra, y es la parte a la que más se oponen las familias y los responsables de protección de datos, con razón. Un asistente de voz en la nube significa una señal de micrófono saliendo del centro.
El reconocimiento de voz en el dispositivo elimina ese flujo. El audio se transcribe en la máquina donde se captó y no se transmite nunca, lo que convierte una conversación difícil en una conversación corta. Además, no hay factura de transcripción por minuto, así que un estudiante puede hablar durante una hora sin que nadie mire el contador.
Sí. Grout ejecuta la conversión de voz a texto, la detección de turnos y la síntesis de voz en el dispositivo, junto a un modelo de lenguaje local, así que puedes mantener una conversación hablada con un tutor de asignatura con la red desconectada. No se transmite ningún audio a ninguna parte.
Sí. La síntesis de voz en el dispositivo lee en voz alta las respuestas del tutor con la voz que elijas. Como las voces son locales, funciona sin conexión y no tiene coste por minuto.
Sí, en cualquier parte del estudio. La detección de actividad de voz y la de fin de intervención hacen que puedas hablar con naturalidad en vez de mantener pulsado un botón, algo que importa cuando tienes las manos en una ficha.
El riesgo concreto de los asistentes de voz es que la voz de un menor se grabe y se envíe a una empresa. El procesamiento en el dispositivo elimina esa transferencia: el audio se transcribe en local y no se sube nunca. Más allá de eso, las familias pueden ver la actividad y fijar límites de tiempo de uso.
Sí. Cada agente tiene su propio prompt de sistema y su propio modelo, así que puedes configurar un tutor de química que exija ecuaciones ajustadas y, aparte, un asesor de redacción que nunca escriba el texto por ti.
El estudio incluye modelos de voz y de lenguaje multilingües, y la propia interfaz está disponible en varios idiomas. La calidad varía según el idioma: los idiomas más hablados funcionan notablemente mejor que los minoritarios.
Descarga gratuita para Windows y macOS. Voz que entra, voz que sale y nada que se suba.
Descarga Grout gratis