En reconocimiento de voz suele ponerse casi toda la atención sobre una métrica: cuántas palabras ha transcrito correctamente el sistema.
En una conversación clínica, sin embargo, existe otra pregunta igual de importante:
¿quién pronunció esas palabras?
Confundir una frase del paciente con una indicación del profesional puede cambiar completamente la interpretación de una transcripción.
Ese es el problema que intenta resolver la diarización de hablantes: dividir una grabación en segmentos y determinar qué intervenciones corresponden a cada persona.
El 23 de septiembre de 2026, NVIDIA publicó Nemotron 3 Diarization, un modelo con pesos abiertos orientado precisamente a este problema.
Qué ha publicado NVIDIA
Según la ficha técnica del modelo, Nemotron 3 Diarization cuenta con 99,2 millones de parámetros y permite trabajar con hasta ocho hablantes, tanto sobre audio grabado como en escenarios de streaming.
NVIDIA indica además una configuración de latencia mínima de 0,32 segundos, una característica especialmente relevante para aplicaciones que necesitan procesar conversaciones mientras se están produciendo.
En el benchmark DIHARD III, la compañía reporta una tasa de error de diarización —DER, por sus siglas en inglés— del 12,73 % en modo offline.
Con la configuración de mínima latencia, el resultado comunicado es de 13,55 %.
El modelo anterior de cuatro hablantes utilizado en la comparación alcanzaba un DER del 19,09 %.
Qué significa realmente la diarización
Un sistema de reconocimiento automático del habla puede producir una transcripción correcta y, aun así, resultar insuficiente para documentar una conversación.
Imaginemos un fragmento sencillo:
— Me duele desde el lunes. — ¿Ha tomado algún medicamento? — Ibuprofeno.
La transcripción contiene todas las palabras.
Pero sin conocer los turnos, el sistema pierde una parte fundamental de la estructura de la conversación.
En una consulta real el problema es considerablemente más complejo. Hay interrupciones, silencios, cambios rápidos de turno, voces que se superponen y conversaciones que pueden prolongarse durante muchos minutos.
Por eso la diarización no es un añadido estético a la transcripción. Es una capa que ayuda a reconstruir la conversación.
El dato importante que todavía falta: español clínico
Los resultados publicados por NVIDIA son prometedores, pero no permiten concluir automáticamente que el comportamiento sea equivalente en una consulta sanitaria en España.
Según la información incluida en la ficha del modelo, los datos de entrenamiento incluyen inglés, mandarín, hindi, canarés, telugu y bengalí.
Además, DIHARD III es un benchmark de diarización exigente, pero no representa específicamente conversaciones clínicas en español.
Esa diferencia importa.
La combinación de idioma, acústica, duración de la consulta, número de participantes, interrupciones y formas naturales de hablar puede modificar sustancialmente el rendimiento de un sistema.
Por tanto, antes de incorporar cualquier modelo a una arquitectura clínica es necesario evaluarlo sobre el contexto en el que realmente se pretende utilizar.
Del benchmark a una consulta real
Esta diferencia entre una buena métrica pública y el comportamiento del sistema en situaciones reales es precisamente una de las cuestiones que estamos estudiando en Myukura.
Durante nuestra participación en el 8.º MareNostrum Hackathon del Barcelona Supercomputing Center trabajamos sobre reconocimiento de voz clínico en español y sobre las dificultades que aparecen cuando estos sistemas se enfrentan a vocabulario médico, diferentes acentos y conversaciones prolongadas.
La diarización forma parte del mismo problema general.
No basta con obtener una buena transcripción aislada. El objetivo es preservar la estructura necesaria para poder trabajar después sobre esa información.
Por qué los modelos abiertos son relevantes
Nemotron 3 Diarization se publica bajo licencia OpenMDW v1.1 y con pesos disponibles públicamente.
La posibilidad de estudiar y ejecutar modelos de este tipo fuera de servicios completamente cerrados es especialmente interesante para líneas de investigación relacionadas con procesamiento local.
Permite a investigadores y equipos técnicos evaluar el comportamiento del modelo, medir sus requisitos de hardware y estudiar arquitecturas donde determinadas etapas del procesamiento no dependan necesariamente de enviar toda la información a un servicio remoto.
Seguimos este tipo de publicaciones como referencia para nuestra investigación sobre procesamiento local, dentro de Myukura Edge.
Como miembros de NVIDIA Inception, seguimos especialmente de cerca este tipo de publicaciones, pero con una condición que consideramos fundamental: una ficha técnica o un benchmark constituyen un punto de partida, no una validación para un entorno clínico concreto.
La siguiente pregunta siempre debe ser la misma:
¿cómo funciona con nuestros datos, nuestro idioma y nuestro caso de uso?
Fuentes
Sigue leyendo
- NVIDIA Inception y la línea de I+D de Myukura: modelos especializados e inteligencia artificial localTecnología · 5 de octubre de 2026
- Myukura en el 8.º MareNostrum Hackathon: investigar reconocimiento de voz clínico en español sobre infraestructura GPUInvestigación · 30 de septiembre de 2026
- Más grande no siempre significa mejor: el papel de los modelos especializados en IA clínicaInvestigación · 5 de octubre de 2026

