Inspiration

Aunque el alcance general del proyecto venía predefinido, trate de ir un paso más allá en las funcionalidades clave:

- Smart Chapters: Inspirado en la segmentación temática de YouTube para estructurar la charla automáticamente.

Herramientas de accesibilidad: Un panel con ajustes de contraste y tamaño de fuente pensado para personas con visión reducida.

Resumen ejecutivo por correo: Permite enviar una síntesis de la charla directamente al email del asistente (o integrarse al perfil de usuario en Nerdearla).

Una funcionalidad que no alcance a implementar completamente, pero que resulta a mi juicio prometedora, es un agente asíncrono que enlace las transcripciones con la documentación o las diapositivas de la presentación para facilitar la replicación de workshops. Esta idea está inspirada en Google Grounding Search, donde se añaden citas estructuradas a la respuesta del modelo. Lo cual tiene usos para cualquier tipo de capacitacion o workshop en vivo. Asi mismo no pudimos agregar el glosario colaborativo.

What it does

Transcribe audio a español y lo traduce a inglés en tiempo real. Además, detecta automáticamente los cambios de tema del expositor para generar Smart Chapters, e incluye un panel de accesibilidad para visualización de subtítulos y un generador de resúmenes ejecutivos de la sesión.

How we built it

Backend: Desarrollado en Python con FastAPI y WebSockets para transmisión bi-direccional de audio y texto. Frontend: Diseñado en React + Vite con TypeScript y Tailwind CSS. Modelos de IA: Integración con gemini-3.5-transcribe-live-preview y gemini-3.5-live-translate-preview mediante el SDK oficial de Google GenAI. Infraestructura: Despliegue en Google Cloud Run y orquestación con Docker / Docker Compose.

Challenges we ran into

Los mayores retos estuvieron asociados a la latencia de las transcripciones y traducciones, la configuración de roles, la facturación (Billing API), que inicialmente impedía el consumo correcto de los modelos de Gemini en el entorno desplegado.

Accomplishments that we're proud of

Logramos una arquitectura robusta y de baja latencia para streaming de audio utilizando WebSockets, evitando la complejidad técnica de WebRTC para la demostración.

Comprobamos experimentalmente que el costo operativo de procesar transcripciones y traducciones en vivo para charlas o talleres de 20 minutos es sumamente bajo.

Diseñamos una interfaz limpia y optimizada para producción con panel de control de audio, vista de subtítulos y controles de accesibilidad.

What we learned

Cómo integrar y estructurar flujos de audio PCM en tiempo real con la API de Gemini. La flexibilidad de los modelos gemini-3.5-transcribe-live-preview y gemini-3.5-live-translate-preview para tareas continuas. A optimizar costos e infraestructura en la nube para procesamiento e inferencia en vivo.

What's next for Gemini OSS Live Transcriber

Integrarlo con OBS y otras herramientas de streaming profesional y, si a los jueces les parecen útiles las funcionalidades del proyecto, seguir desarrollándolo e implementándolo. Me habría encantado incluir la opción de vincular las transcripciones con documentación o diapositivas, pero no me dio el tiempo para implementarla y tampoco estaba seguro de si le aportaría valor real al equipo de Nerdearla.

Built With

Share this project:

Updates

Submission history