Myukura
Circuito integrado sobre una placa
Investigación

Más grande no siempre significa mejor: el papel de los modelos especializados en IA clínica

Los grandes modelos de lenguaje han ampliado enormemente las posibilidades de la inteligencia artificial, pero no todas las tareas requieren un modelo gigantesco. En extracción de información, verificación y clasificación, distintos trabajos recientes muestran que la especialización puede ser tan importante como el tamaño.

Dominio público · Wikimedia Commons

Durante los últimos años se ha instalado una asociación casi automática entre número de parámetros y capacidad: si un modelo es mayor, debería resolver mejor cualquier problema.

En inteligencia artificial aplicada al ámbito clínico, esa conclusión es demasiado simple.

Una consulta médica no representa una única tarea de IA. Dentro de un mismo flujo pueden aparecer reconocimiento de voz, identificación de entidades clínicas, detección de negaciones, clasificación, comprobación de evidencias, estructuración de información y, finalmente, generación de texto.

Cada problema tiene características distintas.

Y la evidencia disponible apunta a que, para algunas de esas tareas, un modelo entrenado específicamente para resolver un problema concreto puede competir con sistemas mucho mayores y, en determinadas condiciones, superarlos.

Especialización frente a capacidad general

Un estudio publicado en Nature Communications por Chen et al. en 2025 comparó cuatro grandes modelos de lenguaje sobre doce conjuntos de datos de procesamiento de lenguaje biomédico correspondientes a seis tipos de aplicaciones.

Los autores encontraron que los enfoques de ajuste fino tradicionales —incluidos modelos de las familias BERT y BART— superaban a los grandes modelos utilizados en zero-shot o few-shot en buena parte de las tareas evaluadas.

La ventaja de los grandes modelos aparecía especialmente cuando la tarea exigía capacidades más abiertas de razonamiento, como determinadas preguntas médicas.

El trabajo también documentó una cuestión particularmente relevante para aplicaciones sensibles: los sistemas generativos podían producir respuestas aparentemente convincentes que, sin embargo, omitían información o introducían contenido no presente en los datos originales.

No significa que un enfoque sea universalmente mejor que otro. Significa que la arquitectura adecuada depende del trabajo que se le pide hacer.

Verificar una afirmación no es lo mismo que redactar una respuesta

Esta diferencia se observa con claridad en tareas de verificación biomédica.

En un trabajo presentado en el BioNLP Workshop de ACL 2026, Kumar estudió modelos ajustados utilizando únicamente 1.008 ejemplos de entrenamiento y los comparó con grandes modelos propietarios.

En HealthVer, BioLinkBERT alcanzó un macro-F1 de 62,4, frente a 53,2 y 42,4 de los dos modelos propietarios evaluados. Un modelo de 7.000 millones de parámetros ajustado mediante QLoRA alcanzó 65,2.

En SciFact, BioLinkBERT obtuvo 87,5, frente a 85,6 y 77,9.

Los números no deberían leerse como una clasificación universal de modelos. Son resultados dentro de datasets, configuraciones y tareas concretas.

De hecho, el propio trabajo detecta un artefacto estructural en SciFact que puede favorecer las métricas de los modelos ajustados. Por ese motivo, HealthVer constituye una comparación particularmente interesante.

La conclusión importante está en otra parte: no siempre es necesario utilizar el sistema de mayor tamaño disponible para tomar una decisión acotada.

Un filtro rápido antes de una operación costosa

Abbes et al. estudiaron en 2025 otro problema relevante: determinar si la información contenida en un documento es suficiente para responder a una consulta.

En este tipo de clasificación de groundedness, encoders ligeros como RoBERTa o NomicBERT obtuvieron resultados comparables a modelos mucho mayores, pero con una latencia considerablemente inferior.

La arquitectura que se desprende de este tipo de investigaciones resulta interesante: utilizar modelos pequeños y rápidos para filtrar, comprobar o clasificar primero y reservar los modelos generativos más costosos para las etapas en las que realmente aportan valor.

En lugar de preguntar qué modelo puede hacerlo todo, la pregunta pasa a ser:

¿cuál es el modelo más apropiado para cada etapa?

Tampoco hay que idealizar los modelos pequeños

La evidencia no permite concluir que los encoders especializados sean siempre superiores.

Hu et al. compararon en 2024 modelos BERT con modelos de la familia LLaMA ajustados mediante instrucciones para extracción de información clínica.

Los modelos LLaMA obtenían mejoras moderadas en reconocimiento de entidades y extracción de relaciones y mostraban una ventaja mayor cuando se enfrentaban a datos no vistos durante el entrenamiento.

Sin embargo, esa mejora tenía un coste: mayores requisitos computacionales y, en determinadas configuraciones del estudio, una ejecución hasta 28 veces más lenta.

La decisión vuelve a depender de la aplicación.

Precisión, generalización, latencia, coste, consumo de memoria y capacidad de auditoría forman parte del mismo problema de ingeniería.

Qué implica para una arquitectura de IA clínica

Esta discusión tiene consecuencias prácticas.

En aplicaciones clínicas, una arquitectura no debería diseñarse alrededor del modelo que ocupa más titulares, sino alrededor de una sucesión de tareas claramente evaluables.

Un sistema especializado puede resultar especialmente interesante cuando se necesita:

  • extraer información estructurada;
  • detectar determinadas entidades;
  • verificar afirmaciones;
  • clasificar contenido;
  • trabajar con baja latencia;
  • reducir el coste computacional;
  • o ejecutar determinados procesos en infraestructura local.

Los modelos generativos de mayor tamaño continúan teniendo un papel importante cuando la tarea requiere interpretación más abierta o generación compleja.

Ambos enfoques pueden convivir.

La línea que seguimos en Myukura

En Myukura partimos de una idea similar: la calidad de una aplicación clínica no puede medirse únicamente por el nombre o el tamaño del modelo que utiliza.

Importan también la arquitectura que existe alrededor del modelo, los mecanismos de verificación, la trazabilidad de los datos, el tratamiento de los errores y la intervención del profesional.

Por eso desarrollamos y evaluamos tanto modelos generativos como sistemas más pequeños y especializados, orientados a distintas tareas dentro del flujo clínico.

No buscamos que un único modelo haga todo.

Nuestro trabajo consiste en desarrollar una arquitectura en la que cada componente responda a una función concreta y pueda evaluarse de forma independiente antes de incorporarse a un flujo clínico supervisado.

El objetivo es combinar precisión, eficiencia, trazabilidad y control, seleccionando para cada etapa la arquitectura y el nivel de especialización más adecuados.

Fuentes

Sigue leyendo

← Volver al blog