Nemotron 3 Diarization es el modelo de diarización de hablantes de pesos abiertos de NVIDIA para separar hasta ocho voces en audio en directo o grabado. Lanzado el 23 de septiembre de 2026, el modelo de aproximadamente 100 millones de parámetros gestiona el habla superpuesta y puede introducir marcas de tiempo de los hablantes en un sistema de reconocimiento automático del habla, produciendo transcripciones etiquetadas para reuniones, llamadas, entrevistas y pódcasts.
¿Qué hace realmente Nemotron 3 Diarization?
Nemotron 3 Diarization determina cuándo habla cada persona y asigna etiquetas anónimas a hasta ocho hablantes, incluso durante el habla superpuesta. El modelo de 2026 procesa transmisiones en directo o grabaciones ya finalizadas, devolviendo marcas de tiempo en intervalos configurables de 10 milisegundos en lugar de identificar a los participantes por su nombre o transcribir sus palabras.
La diarización de hablantes es una tarea de procesamiento de audio que divide el habla por hablante y responde a la pregunta «¿quién habló cuándo?». El modelo de NVIDIA nombra los canales según el orden en que aparecen por primera vez las voces. El primer participante detectado se convierte en el primer canal, pero el sistema no conoce la identidad de esa persona.
Emparejar el diarizador con el reconocimiento automático del habla, o ASR, convierte esos intervalos de tiempo en una transcripción atribuida por hablante. Por tanto, una aplicación de reuniones puede asociar las palabras reconocidas con el Hablante 1 o el Hablante 2, mientras que un sistema de análisis de llamadas puede separar el habla de un agente de la de un cliente.
La distinción importa. La tasa de error de diarización mide la segmentación incorrecta de hablantes, el habla omitida, las detecciones falsas de habla y la confusión entre hablantes; no es una puntuación de precisión de palabras. La calidad del audio también sigue siendo importante, por lo que los desarrolladores que preparan grabaciones comprimidas deberían entender cómo la tasa de bits afecta a la calidad de audio utilizable antes de culpar al modelo de cada error.
¿Qué precisión tiene Nemotron 3 Diarization?
Nemotron 3 Diarization ocupó el primer puesto entre 12 sistemas en la primera Diarization-Bench de 2026 de VoiceArena, registrando una tasa de error de diarización del 14.72%. El segundo clasificado, DiariZen WavLM Large s80 MD v2, obtuvo 19.34% en las mismas 139 conversaciones en inglés y aproximadamente 22 horas de audio evaluado.
| Sistema o métrica | Resultado de 2026 | Lo que indica |
|---|---|---|
| DER de Nemotron 3 Diarization | 14.72% | Error total de diarización |
| DER de DiariZen WavLM Large s80 MD v2 | 19.34% | Error total del sistema en segundo lugar |
| JER de Nemotron | 25.53% | Error de superposición por hablante |
| Precisión exacta en el recuento de hablantes | 83.45% | Grabaciones con el número correcto de hablantes |
| Voz omitida | 3.63% | Voz no detectada |
| Falsas alarmas | 8.88% | Sonido no vocal marcado como voz |
| Confusión de hablantes | 2.21% | Voz asignada al hablante incorrecto |
El titular comparación supone una reducción de 4,62 puntos porcentuales en el DER. Comparado con el resultado del 19,341 % de DiariZen, la puntuación del 14,721 % de NVIDIA es aproximadamente un 23,91 % inferior. Es una ventaja significativa, aunque un único benchmark no debe considerarse una clasificación universal.
VoiceArena incluyó voz superpuesta, detección de actividad de voz generada por el sistema y un margen de puntuación de cero milisegundos en su prueba de 2026. Su intervalo de confianza publicado de 95% para el resultado de NVIDIA fue aproximadamente de 13.4% a 16.1%, lo que muestra la incertidumbre en torno a una puntuación obtenida a partir de un conjunto de prueba finito.
Las conversaciones en inglés dominaron el benchmark inicial, por lo que el resultado no establece un rendimiento equivalente actuación para todos los idiomas, salas, micrófonos o estilos de habla. Argmax informó por separado en 2026 de que el modelo logró el DER medio más bajo en su comparación de OpenBench con seis sistemas y 11 conjuntos de datos, y lideró cinco conjuntos de datos individualmente. Es una corroboración útil, sí. Una garantía para tus grabaciones, no.
¿Cuánta latencia añade el seguimiento de hablantes en directo?
Nemotron 3 Diarization acepta búferes que van desde unos experimentales 80 milisegundos hasta 30.4 segundos, según la ficha del modelo de NVIDIA de 2026. NVIDIA recomienda al menos 0.32 segundos para streaming, pero los búferes más cortos devuelven decisiones antes a costa de un mayor error de diarización en la evaluación NOTSOFAR1-MHM de la empresa.
NVIDIA informó de una DER de 6.77% con un búfer de 30.4 segundos en 2026. El error aumentó a 7.70% con 1.04 segundos y a 8.65% con 0.32 segundos. Por tanto, pasar de la configuración probada más larga a la configuración recomendada de baja latencia aumentó la DER en 1.88 puntos porcentuales, o aproximadamente un 27.8% en relación con la línea base de 6.77%.
Deberías elegir el búfer en función de la experiencia del producto, no del número más pequeño en la pantalla de configuración. Los subtítulos en directo y el software de asistencia para agentes pueden justificar un búfer de 0.32 segundos, mientras que una entrevista subida puede tolerar una ventana de 30.4 segundos a cambio de una mejor segmentación.
La entrada debe ser audio mono muestreado a 16 kHz. La inferencia por fragmentos elimina un límite fijo en la duración de la grabación, y la resolución de salida puede configurarse en incrementos de 10 milisegundos. Una granularidad de salida baja no elimina la compensación del búfer: las marcas de tiempo pueden ser precisas mientras el sistema sigue necesitando más audio circundante para decidir quién habló.
¿Dónde encaja el modelo en una pila práctica de voz?
Nemotron 3 Diarization encaja entre la ingestión de audio y el ensamblaje de la transcripción en una pila de voz de 2026. El modelo separa a los hablantes primero o junto con el ASR, tras lo cual una aplicación alinea las palabras reconocidas con los canales de hablante para notas de reuniones, análisis de llamadas, entrevistas, edición de pódcast o transcripción privada.
El entorno de ejecución NeMo-Speech.cpp de NVIDIA admite el diarizador por sí solo o combinado con ASR. El proyecto añadió compatibilidad desde el primer día en 2026 para transcripción en directo con micrófono, ejecución local de GGUF, un preajuste para ocho hablantes, tramas de salida de 10 milisegundos y conversión opcional Q8_0.
Una revisión de despliegue sensata cubre las siguientes comprobaciones prácticas:
- Convierte el audio entrante a entrada mono de 16 kHz y prueba el efecto del códec de origen.
- Selecciona un búfer utilizando la latencia medida y el DER en tus propias conversaciones.
- Combina la diarización con ASR cuando el producto requiera palabras además de la temporización del hablante.
- Asigna canales anónimos a nombres conocidos solo mediante un flujo de trabajo independiente y consciente del consentimiento.
- Prueba reuniones con interrupciones, silencio, audio de fondo y más de ocho participantes.
Argmax Pro SDK 3 añadió compatibilidad en tiempo real y transcripción con atribución de hablante para hasta ocho participantes en 2026. Argmax también presentó una API de transcripción “pre-diarized” que separa a los hablantes antes del reconocimiento, afirmando una transcripción mejorada para conversaciones complejas con solapamientos.
Para grabaciones sensibles, la ejecución local puede reducir la necesidad de enviar voces sin procesar a un servicio externo. Las empresas siguen necesitando gobernanza en torno a los binarios, los pesos del modelo, la retención de transcripciones y los agentes posteriores; una revisión de plataformas de descubrimiento de shadow AI puede ayudar a identificar herramientas de voz no gestionadas, mientras que riesgos de seguridad empresarial relacionados con agentes siguen siendo relevantes cuando las transcripciones activan acciones automatizadas.
¿Cuáles son las mayores limitaciones del modelo?
Nemotron 3 Diarization no puede identificar a las personas por su nombre, transcribir voz por sí solo ni representar de forma fiable más de ocho canales simultáneos de hablante. La documentación del modelo de NVIDIA de 2026 advierte que el audio con más de ocho hablantes puede provocar pérdida de voz o asignaciones a un canal incorrecto.
El límite de ocho hablantes es fácil de pasar por alto porque muchas llamadas normales se mantienen por debajo de él. Un panel de nueve personas, una discusión de aula rotatoria o una gran reunión híbrida son casos límite con consecuencias reales: el modelo no simplemente crea una novena etiqueta. La voz puede desaparecer de la salida o fusionarse con un canal existente.
Las etiquetas anónimas también requieren un texto de producto cuidadoso. Speaker 1 no es una identidad verificada, y el orden de los canales puede cambiar entre grabaciones independientes porque las etiquetas siguen el orden de primera aparición. Si necesitas nombres, necesitarás metadatos de los participantes, asignación manual o un sistema independiente de identificación por voz con el consentimiento adecuado y revisión legal.
NVIDIA describe la arquitectura de 2026 como un codificador Transformer de 31 capas que utiliza incrustaciones posicionales rotatorias, tramas de codificador de 80 milisegundos y una capa Conv1D que restaura las predicciones a una resolución de 10 milisegundos. NVIDIA también afirma que el entrenamiento utilizó aproximadamente 10.000 horas de conversaciones reales más mezclas simuladas con entre uno y ocho hablantes. Esos detalles ayudan a explicar el alcance del modelo compacto, pero tu audio de producción sigue siendo la prueba decisiva.
La licencia OpenMDW 1.1 permite el uso comercial y no comercial, según la ficha del modelo de 2026. Sinceramente, el lanzamiento tiene más sentido cuando valoras el control local, la compatibilidad con streaming o unos pesos inspeccionables; una API de transcripción alojada puede seguir siendo más sencilla si tu equipo no quiere operar una canalización de audio.
Preguntas frecuentes sobre Nemotron 3 Diarization
¿Es Nemotron 3 Diarization de código abierto?
Nemotron 3 Diarization es un modelo de pesos abiertos publicado bajo la licencia OpenMDW 1.1 en 2026. NVIDIA describe los pesos como disponibles para uso comercial y no comercial, pero los equipos deben revisar los términos de la licencia para la distribución y el despliegue previstos.
¿Nemotron 3 Diarization transcribe audio?
Nemotron 3 Diarization no convierte el habla en palabras. El modelo proporciona etiquetas anónimas de hablantes y marcas de tiempo, que pueden combinarse con un modelo ASR para crear una transcripción atribuida a cada hablante.
¿Puede Nemotron 3 Diarization ejecutarse localmente?
Nemotron 3 Diarization puede ejecutarse localmente mediante el entorno de ejecución NeMo-Speech.cpp de NVIDIA, que incorporó la ejecución de GGUF y la compatibilidad con micrófonos en directo en 2026. Los ports comunitarios de Core ML y MLX INT8 para Manzana Silicon aparecieron el 24 de septiembre de 2026, pero esas conversiones no fueron lanzamientos oficiales de NVIDIA.
¿Qué formato de audio requiere Nemotron 3 Diarization?
Nemotron 3 Diarization acepta audio mono muestreado a 16 kHz, según la ficha del modelo de NVIDIA de 2026. Las grabaciones largas pueden procesarse mediante inferencia por fragmentos en lugar de una longitud máxima de grabación fija.


