Logo
Modo voz

Habla con un tutor
que nunca llama a casa.

El reconocimiento de voz, la detección de turnos y la síntesis de voz funcionan en tu propio ordenador. Haz una pregunta en voz alta, recibe la explicación hablada y sigue adelante, con el wifi apagado y sin que salga ningún audio de la sala.

Qué hace que la conversación funcione

Cuatro modelos cooperando en el dispositivo: reconocimiento de voz, detección de turnos, el propio tutor y una voz.

Reconocimiento de voz sin conexión

La conversión de voz a texto se ejecuta en el dispositivo con modelos Parakeet. Tu voz se transcribe en tu propia máquina y no se transmite ningún audio a un servidor.

Detección de turnos en tiempo real

Un modelo específico de fin de intervención decide cuándo has terminado de hablar, así que la conversación fluye en lugar de esperar una pausa fija o que pulses un botón.

Detección de actividad de voz

Silero VAD separa el habla del ruido de la sala, que es lo que hace viable el uso con las manos libres en un aula real y no en un estudio en silencio.

Síntesis de voz local

El tutor responde en voz alta con voces que corren en el dispositivo. Elige una voz y funcionará con la red apagada, como todo lo demás.

Tutores que configuras tú

Crea un agente por asignatura con su propio prompt de sistema y su propio modelo. Un tutor de física que desarrolla demostraciones se comporta distinto a un compañero de conversación de idiomas.

Explica en lugar de responder

Los agentes están configurados para resolver el problema contigo. Eso es a la vez mejor pedagogía y el uso de la IA que la normativa de tu centro casi con seguridad permite.

Práctica de idiomas

Habla en el idioma que estás aprendiendo y recibe las correcciones explicadas en vez de aplicadas en silencio, con modelos multilingües atendiendo ambos lados.

Transcripción de clases

El mismo motor de voz transcribe una clase grabada o una entrevista a texto que luego puedes resumir o buscar.

Por qué la voz es el modo que se acaba usando

Escribir una pregunta es un peaje pequeño, pero se cobra cada vez. Basta para que un estudiante atascado en el paso cuatro de una demostración se quede mirándola en lugar de describir el problema en un cuadro de texto. Hablar elimina ese peaje, y el número de preguntas sube mucho.

También cambia el tipo de pregunta. Las preguntas escritas tienden a estar bien formuladas y cerradas. Las habladas están a medio formar, que es justo el estado en el que está un estudiante cuando la ayuda le sería más útil.

Por qué aquí ejecutarlo en local importa más que en ningún otro sitio

El texto es una cosa. Un flujo continuo de audio desde el pupitre de un menor es otra, y es la parte a la que más se oponen las familias y los responsables de protección de datos, con razón. Un asistente de voz en la nube significa una señal de micrófono saliendo del centro.

El reconocimiento de voz en el dispositivo elimina ese flujo. El audio se transcribe en la máquina donde se captó y no se transmite nunca, lo que convierte una conversación difícil en una conversación corta. Además, no hay factura de transcripción por minuto, así que un estudiante puede hablar durante una hora sin que nadie mire el contador.

Preguntas frecuentes

¿Existe un tutor de voz con IA que funcione sin conexión?+

Sí. Grout ejecuta la conversión de voz a texto, la detección de turnos y la síntesis de voz en el dispositivo, junto a un modelo de lenguaje local, así que puedes mantener una conversación hablada con un tutor de asignatura con la red desconectada. No se transmite ningún audio a ninguna parte.

¿El tutor de IA habla en voz alta?+

Sí. La síntesis de voz en el dispositivo lee en voz alta las respuestas del tutor con la voz que elijas. Como las voces son locales, funciona sin conexión y no tiene coste por minuto.

¿Puedo usar la voz en lugar de escribir?+

Sí, en cualquier parte del estudio. La detección de actividad de voz y la de fin de intervención hacen que puedas hablar con naturalidad en vez de mantener pulsado un botón, algo que importa cuando tienes las manos en una ficha.

¿Es seguro que un menor hable con un tutor de IA?+

El riesgo concreto de los asistentes de voz es que la voz de un menor se grabe y se envíe a una empresa. El procesamiento en el dispositivo elimina esa transferencia: el audio se transcribe en local y no se sube nunca. Más allá de eso, las familias pueden ver la actividad y fijar límites de tiempo de uso.

¿Puedo crear un tutor para una asignatura concreta?+

Sí. Cada agente tiene su propio prompt de sistema y su propio modelo, así que puedes configurar un tutor de química que exija ecuaciones ajustadas y, aparte, un asesor de redacción que nunca escriba el texto por ti.

¿La voz funciona en idiomas distintos del inglés?+

El estudio incluye modelos de voz y de lenguaje multilingües, y la propia interfaz está disponible en varios idiomas. La calidad varía según el idioma: los idiomas más hablados funcionan notablemente mejor que los minoritarios.

Pregunta en voz alta

Descarga gratuita para Windows y macOS. Voz que entra, voz que sale y nada que se suba.

Descarga Grout gratis