Módulo 11

Conceptos de modelo avanzados


No es un requisito para ningún otro módulo: es conocimiento de fondo para entender cómo funcionan por debajo los modelos que ya usas. Se puede leer en cualquier momento.

Tiempo de lectura: 3 min

Mixture of Experts (MoE)

Mixture of Experts es una arquitectura de modelo en la que la red tiene muchos «expertos» (subredes) y, para cada token, un mecanismo de enrutamiento activa solo unos pocos. El modelo tiene muchos parámetros en total, pero en cada paso solo usa una fracción.

El resultado es un modelo con la capacidad de uno muy grande y un coste de inferencia más cercano al de uno mediano. Muchos modelos actuales, tanto comerciales como abiertos, usan esta arquitectura. Para quien construye aplicaciones no cambia la forma de usarlos, pero ayuda a entender por qué algunos modelos grandes son sorprendentemente rápidos y baratos.

Context distillation

La context distillation es una técnica de entrenamiento que hace que un modelo interiorice el comportamiento que tendría con un prompt largo (instrucciones detalladas, ejemplos) para que lo reproduzca sin necesidad de recibir ese prompt. Se generan respuestas con el contexto completo y se entrena al modelo para que las dé sin él.

Es una forma de fine-tuning orientada a ahorrar contexto: menos tokens por llamada y, por tanto, menos coste y menos latencia. Tiene sentido cuando un mismo prompt largo se repite en un volumen muy alto. En la mayoría de aplicaciones, el prompt caching consigue un ahorro parecido sin entrenar nada.

Multimodalidad

Un modelo multimodal puede procesar (y, en algunos casos, generar) más de un tipo de dato: texto, imágenes, audio, vídeo o documentos PDF. Puedes enviarle la foto de un producto roto, una captura de pantalla de un error o una factura escaneada y preguntarle directamente por su contenido.

Abre casos que antes necesitaban sistemas específicos, como extraer datos de documentos, entender capturas de pantalla o transcribir y resumir llamadas. Las imágenes y el audio consumen muchos tokens, y la precisión en los detalles pequeños (las cifras de un documento borroso, por ejemplo) no es perfecta: lo que se extraiga se debe validar como cualquier otra salida del modelo.

Reasoning models

Los reasoning models son modelos entrenados para razonar antes de responder: generan una cadena de pensamiento interna (a veces visible, a veces no) y dedican más tiempo de cálculo a los problemas difíciles. Muchos permiten ajustar cuánto deben pensar con un presupuesto de tokens de razonamiento o un nivel de esfuerzo.

Son claramente mejores en tareas de varios pasos (planificación, matemáticas, código, análisis complejo), pero son más lentos y más caros, porque los tokens de razonamiento también se pagan. En tareas sencillas, como clasificar, extraer o reformular, no aportan mucho. Son un buen candidato para el model routing (Módulo 7): razonamiento solo donde se nota.

Examínate de este módulo

Copia este prompt y pégalo en tu IA (ChatGPT, Claude, Gemini…). Te hará un test de 20 preguntas sobre los conceptos del módulo y después te propondrá un ejercicio práctico.

Actúa como examinador de la «Guía de Ingeniería IA» de Dani Pérez. Examíname del módulo «Conceptos de modelo avanzados» (https://daniperez.pro/resources/ai-engineering-guide/advanced-model-concepts).

Conceptos que entran en el examen:
- Mixture of Experts (MoE)
- Context distillation
- Multimodalidad
- Reasoning models

Examen:
1. 20 preguntas tipo test, cada una con 4 opciones (a, b, c, d) y una sola respuesta correcta.
2. Pregunta sobre comprensión y criterio (para qué sirve cada cosa y cuándo NO usarla), no sobre memorizar definiciones.
3. Reparte la posición de la respuesta correcta de forma equilibrada entre a, b, c y d.
4. Hazme las preguntas en 4 tandas de 5. No pongas ningún ejemplo de respuesta (como "1a 2b 3c 4d 5a"): yo ya sé que debo responder con las letras. No me digas si he acertado hasta que haya respondido las 20.
5. Al final, corrígelas todas: para cada pregunta, mi respuesta, la correcta y una explicación breve. Dame la nota sobre 20 y dime qué conceptos debo repasar.

Ejercicio práctico (después de la corrección):
6. Pregúntame qué aplicación tengo o quiero construir, y con qué lenguaje y framework trabajo. Si no tengo ninguna, usa esta: la aplicación de atención al cliente de una tienda online, con tickets, clientes, pedidos y una base de conocimiento (FAQ y políticas de devolución). En ese caso, centra el ejercicio en: tickets que llegan con una captura de pantalla del error, para aplicar la multimodalidad; si lo prefiero, plantéame un ejercicio de reflexión sobre cuándo compensa un reasoning model.
7. Propónme un ejercicio que aplique los conceptos de este módulo a esa aplicación: objetivo, requisitos, criterios para darlo por bueno y errores habituales a evitar.
8. No me lo resuelvas. Cuando te traiga mi solución, revísala con esos criterios.