Jarvis Web — asistente conversacional multimodal
El problema
Los asistentes de IA por voz suelen requerir apps nativas o integraciones complejas, cuando muchos casos de uso solo necesitan una interfaz web accesible, con reconocimiento de voz y respuesta hablada, adaptable a distintos contextos de conversación.
La solución
Un asistente conversacional multimodal (texto y voz) con distintos modos de personalidad según el caso de uso, que combina reconocimiento de voz, conversación con IA y síntesis de voz en una sola interfaz web — sin necesidad de instalar nada.
Stack técnico
| Componente | Tecnología |
|---|---|
| Conversación | OpenAI GPT-4o-mini |
| Reconocimiento de voz | Whisper |
| Síntesis de voz | OpenAI TTS |
| Backend | FastAPI |
| Frontend | Interfaz web servida con nginx |
| Infraestructura | Docker Compose con health checks |
| Arquitectura | Preparada para integrar RAG (Retrieval-Augmented Generation) a futuro |
Resultado / impacto
Release estable con chat en tiempo real, grabación de voz, selección de personalidad y diagnóstico de conectividad funcionando. Memoria persistente, RAG y soporte multiusuario quedan en el roadmap — no hay métricas cuantitativas de uso reportadas en el repositorio.
¿Tienes un desafío similar?
Conversemos 30 minutos para ver si puedo ayudarte.