Caso de estudioComunicación e idiomasNavegador web

goMeetalk

Demo funcional avanzada · Proyecto experimental pausado

Videollamadas con traducción de voz durante la propia conversación, en varios idiomas a la vez.

React · Node.js · Python · LiveKit · IA de voz

Portada de goMeetalk

Resumen y problema

goMeetalk es una plataforma de videoconferencia con traducción simultánea de voz: cada participante habla en su idioma y el resto de la sala lo escucha, durante la propia conversación, en el idioma que haya elegido. La traducción y la síntesis de voz se generan mediante procesamiento en tiempo real, no como una transcripción posterior.

El proyecto llegó a construirse como un sistema funcional de extremo a extremo —videollamada, reconocimiento de voz, traducción, síntesis de voz, sistema de planes e integración con Stripe, panel de administración— y se desplegó en un entorno real con acceso restringido por invitación.

Los equipos que trabajan en varios idiomas a la vez pierden fluidez en sus reuniones: alguien tiene que traducir a mano, o la conversación se ralentiza esperando a quien menos domina el idioma común. goMeetalk parte de la idea de que cada persona hable en su idioma y el resto la escuche en el suyo, sin salir de la reunión.

Cómo funciona

  1. Habla en tu idioma

    La interfaz web captura audio y vídeo mientras cada participante habla en su propio idioma.

  2. Audio en tiempo real

    El audio viaja en tiempo real a través de LiveKit (WebRTC).

  3. Reconocimiento de voz

    Un agente reconoce el habla mediante Azure o Google Cloud, según el motor (o el navegador en el plan gratuito).

  4. Traducción y síntesis

    El texto se traduce y se sintetiza como voz en el idioma de cada oyente.

  5. Cada oyente en su idioma

    Cada oyente recibe la reunión en su propio idioma, dentro de la propia sesión.

Mi papel

Definí el producto, el alcance y las decisiones principales de arquitectura, y dirigí un proceso de desarrollo asistido por IA en el que distintos agentes participaron en la implementación, revisión y verificación del sistema. Mi trabajo fue convertir una idea en requisitos, arquitectura, pruebas y un sistema funcional — no generar código sueltando prompts.

Arquitectura y tecnologías

Frontend

React 19 + Material UI — interfaz de videollamada y configuración de voz/idioma.

Backend

Node.js + Express + Socket.IO — usuarios, organizaciones y lógica de sala en tiempo real; panel de administración interno con React Admin.

Agente de traducción

Python sobre el SDK de LiveKit — reconocimiento de voz, traducción y síntesis.

Datos

PostgreSQL (persistente) + Redis (estado de sala y caché).

Tiempo real

LiveKit (WebRTC) — transporte de audio y vídeo entre los participantes de la sala.

Infraestructura

Render.com + Cloudflare (CDN), con LiveKit Cloud para vídeo y audio.

Decisiones y desafíos

Decisiones
  • Aislamiento estricto de credenciales (BYOK)

    El sistema aplica aislamiento estricto entre las credenciales del cliente y las de la plataforma, evitando respaldos silenciosos.

  • Separar síntesis y publicación de audio

    Sintetizar la voz y publicarla en la sala son procesos distintos. Así, el componente de tiempo real nunca ve las credenciales del cliente.

  • Aplazar cambios sin evidencia suficiente

    Se evaluó unificar el reconocimiento de voz en la nube y se decidió aplazarlo, documentando el motivo.

Desafíos
  • Bloqueo accidental de páginas en inglés

    Un cambio de configuración bloqueó por error las páginas en inglés durante una semana. Se diagnosticó con datos reales y se corrigió con tres cambios verificados uno a uno.

  • Uso accidental de credenciales de la plataforma

    Clientes empresariales podían usar por error las credenciales de la plataforma en vez de las suyas. Se corrigió con una regla de bloqueo en cada llamada a un proveedor externo.

  • Detección incorrecta del idioma

    El idioma de un participante se detectaba mal a veces, generando traducciones incoherentes. Se corrigió transportándolo explícitamente y se validó en una sesión real.

Testing, seguridad y resultado

42

idiomas en el catálogo de traducción

+96 %

cobertura de código (abril de 2026)

Unit · integración · E2E

suite de pruebas automatizadas

Pipeline de integración continua con verificación automática antes de cada cambio, ejecutada contra base de datos y caché reales.

Seguridad y privacidad

Sin grabaciones persistentes de audio o vídeo: la única opción es local, iniciada por el usuario. Contraseñas con bcrypt, comunicación cifrada, MFA opcional, SSO empresarial (SAML/SCIM) y autoevaluación interna de seguridad — sin certificación externa.

Resultado

goMeetalk funcionó como sistema completo de extremo a extremo: integraciones reales de voz e IA, panel de administración y despliegue con tráfico medible. Se validó en un entorno desplegado, no solo en local.

Capturas

Vídeo

Ficha técnica
Tipo de aplicación
Aplicación web
Plataforma
Navegador web
Estado
Funcional
Disponibilidad
Caso de estudio
Tecnologías principales
React · Node.js · Python · LiveKit (WebRTC) · PostgreSQL · Redis · Azure / Google Cloud (voz y traducción) · ElevenLabs / Deepgram (síntesis de voz adicional)
  • #Traducción en tiempo real
  • #Conversaciones
  • #Accesibilidad
Caso de estudioFuncional

Próxima etapa

Demo funcional avanzada · Proyecto experimental pausado

goMeetalk ha alcanzado el estado de demo funcional avanzada y está preparado para explorar una nueva etapa. Actualmente se valoran oportunidades de inversión pre-seed, alianzas estratégicas o una posible adquisición del proyecto.

El acceso público permanece cerrado mientras se define su siguiente fase.

¿Necesitas desarrollar una aplicación con voz, traducción o inteligencia artificial?