goMeetalk
Demo funcional avanzada · Proyecto experimental pausado
Videollamadas con traducción de voz durante la propia conversación, en varios idiomas a la vez.
React · Node.js · Python · LiveKit · IA de voz

Resumen y problema
goMeetalk es una plataforma de videoconferencia con traducción simultánea de voz: cada participante habla en su idioma y el resto de la sala lo escucha, durante la propia conversación, en el idioma que haya elegido. La traducción y la síntesis de voz se generan mediante procesamiento en tiempo real, no como una transcripción posterior.
El proyecto llegó a construirse como un sistema funcional de extremo a extremo —videollamada, reconocimiento de voz, traducción, síntesis de voz, sistema de planes e integración con Stripe, panel de administración— y se desplegó en un entorno real con acceso restringido por invitación.
Los equipos que trabajan en varios idiomas a la vez pierden fluidez en sus reuniones: alguien tiene que traducir a mano, o la conversación se ralentiza esperando a quien menos domina el idioma común. goMeetalk parte de la idea de que cada persona hable en su idioma y el resto la escuche en el suyo, sin salir de la reunión.
Cómo funciona
Habla en tu idioma
La interfaz web captura audio y vídeo mientras cada participante habla en su propio idioma.
Audio en tiempo real
El audio viaja en tiempo real a través de LiveKit (WebRTC).
Reconocimiento de voz
Un agente reconoce el habla mediante Azure o Google Cloud, según el motor (o el navegador en el plan gratuito).
Traducción y síntesis
El texto se traduce y se sintetiza como voz en el idioma de cada oyente.
Cada oyente en su idioma
Cada oyente recibe la reunión en su propio idioma, dentro de la propia sesión.
Mi papel
Definí el producto, el alcance y las decisiones principales de arquitectura, y dirigí un proceso de desarrollo asistido por IA en el que distintos agentes participaron en la implementación, revisión y verificación del sistema. Mi trabajo fue convertir una idea en requisitos, arquitectura, pruebas y un sistema funcional — no generar código sueltando prompts.
Arquitectura y tecnologías
Frontend
React 19 + Material UI — interfaz de videollamada y configuración de voz/idioma.
Backend
Node.js + Express + Socket.IO — usuarios, organizaciones y lógica de sala en tiempo real; panel de administración interno con React Admin.
Agente de traducción
Python sobre el SDK de LiveKit — reconocimiento de voz, traducción y síntesis.
Datos
PostgreSQL (persistente) + Redis (estado de sala y caché).
Tiempo real
LiveKit (WebRTC) — transporte de audio y vídeo entre los participantes de la sala.
Infraestructura
Render.com + Cloudflare (CDN), con LiveKit Cloud para vídeo y audio.
Decisiones y desafíos
Aislamiento estricto de credenciales (BYOK)
El sistema aplica aislamiento estricto entre las credenciales del cliente y las de la plataforma, evitando respaldos silenciosos.
Separar síntesis y publicación de audio
Sintetizar la voz y publicarla en la sala son procesos distintos. Así, el componente de tiempo real nunca ve las credenciales del cliente.
Aplazar cambios sin evidencia suficiente
Se evaluó unificar el reconocimiento de voz en la nube y se decidió aplazarlo, documentando el motivo.
Bloqueo accidental de páginas en inglés
Un cambio de configuración bloqueó por error las páginas en inglés durante una semana. Se diagnosticó con datos reales y se corrigió con tres cambios verificados uno a uno.
Uso accidental de credenciales de la plataforma
Clientes empresariales podían usar por error las credenciales de la plataforma en vez de las suyas. Se corrigió con una regla de bloqueo en cada llamada a un proveedor externo.
Detección incorrecta del idioma
El idioma de un participante se detectaba mal a veces, generando traducciones incoherentes. Se corrigió transportándolo explícitamente y se validó en una sesión real.
Testing, seguridad y resultado
42
idiomas en el catálogo de traducción
+96 %
cobertura de código (abril de 2026)
Unit · integración · E2E
suite de pruebas automatizadas
Pipeline de integración continua con verificación automática antes de cada cambio, ejecutada contra base de datos y caché reales.
Seguridad y privacidad
Sin grabaciones persistentes de audio o vídeo: la única opción es local, iniciada por el usuario. Contraseñas con bcrypt, comunicación cifrada, MFA opcional, SSO empresarial (SAML/SCIM) y autoevaluación interna de seguridad — sin certificación externa.
Resultado
goMeetalk funcionó como sistema completo de extremo a extremo: integraciones reales de voz e IA, panel de administración y despliegue con tráfico medible. Se validó en un entorno desplegado, no solo en local.
Capturas
Vídeo
Ficha técnica
- Tipo de aplicación
- Aplicación web
- Plataforma
- Navegador web
- Estado
- Funcional
- Disponibilidad
- Caso de estudio
- Tecnologías principales
- React · Node.js · Python · LiveKit (WebRTC) · PostgreSQL · Redis · Azure / Google Cloud (voz y traducción) · ElevenLabs / Deepgram (síntesis de voz adicional)
- #Traducción en tiempo real
- #Conversaciones
- #Accesibilidad
Próxima etapa
Demo funcional avanzada · Proyecto experimental pausado
goMeetalk ha alcanzado el estado de demo funcional avanzada y está preparado para explorar una nueva etapa. Actualmente se valoran oportunidades de inversión pre-seed, alianzas estratégicas o una posible adquisición del proyecto.
El acceso público permanece cerrado mientras se define su siguiente fase.
¿Necesitas desarrollar una aplicación con voz, traducción o inteligencia artificial?

