API TEST LINK : https://governmental-hook-fill-instances.trycloudflare.com/detect

Leer README.md (https://github.com/jsencinas/Synthia_hackmty26/blob/main/README.md)

Inspiración Hoy en día la voz ya no es una prueba confiable de identidad. La IA puede generar voces cada vez más realistas, creando un nuevi riesgo para la seguridad bancaria por ejemplo. Synthia nace para agregar esa capa de seguridad para dar apoyo en la identificación de voz sintetica durante una llamada.

¿Qué hace? Synthia analiza llamadas estéreo para distinguir entre voz humana y voz generada por IA. Analiza señales como latencia de respuesta, pausas, interrupciones, ritmo, pitch, jitter, shimmer y caracteristicas espectrales. Conbinandolas mediante modelos de Machine Learning para generar una evaluación de confianza y obtener resultados mucho más exactos.

¿Cómo lo contruimos? Desarrollamos una arquitectura multicapa. Un sistema que separa el habla del ruido, mientras dos modelos especializados analizan comportamiento e interaccion y características acústicas de la voz. Sus predicciones se combinan mediante un modelo con calibracion de confianza y una capa linguistica opcional en los casos de incertidumbre. El sistema se presenta listo para usarse como API con FastAPI como herrramienta.

Desafíos El principal reto fue diferenciar voces sintéticas de la variabilidad natural de una persona sin sobreajustarnos a voces específicas. También enfrentamos ruido telefónico, interrupciones, empalmes, restricciones de tiempo real y la necesidad de evitar fuga de datos durante la validación.

Logros Alcanzamos 100% de Balanced Accuracy en 71 de validación speaker-disjoint, con una diferencia de predicción probabilistica de 0.009. El modelo acústico obtuvo un AUC de 1.0, mientras que nuestra estrategia de 3 capas logró más del 95% de concordancia con anotaciones manuales. La evualuación de más de 300 datos puede hacerse en 150-300 ms.

¿Qué aprendimos? Detectar una voz sintética no depende de un único indicador. La combinación de señales de comportamiento, interacción y características acústicas permite construir un sistema mucho más robusto que solo analizar datos reptetitivos. También el uso de validación rigurosa y de fugas de información.

Escalabilidad El siguiente paso es convertir Synthia en una capa de seguridad de voz en tiempo real para llamadas financieras, incorporando datasets más diversos, análisis semántico, puntuación de riesgo continua e integración con sistemas de prevención de fraude para habilitar una verificación adaptativa.

Built With

  • elevenlabs
  • fastapi
  • python
  • xgboost
Share this project:

Updates