multimodal decision model

Modelos de decisión multimodales: decidir sobre imágenes y vídeo

Un modelo de decisión multimodal puntúa una imagen o un fotograma frente a un esquema de preguntas tipadas y devuelve una probabilidad para cada opción permitida en una sola pasada.

Qué significa multimodal aquí

En este contexto, multimodal es una afirmación concreta y útil. Significa que el estado sobre el que razona un modelo de decisión puede ser una imagen o un fotograma de vídeo, y no solo texto o JSON. No significa que el modelo describa la imagen, converse sobre ella ni escriba una descripción. Puntúa la entrada visual frente a tu esquema y devuelve una probabilidad por cada opción que permitiste.

Clef y Clef-Flash incluyen un codificador de visión integrado, publicados el 1 de octubre de 2026 bajo la licencia Apache 2.0 y con un contexto de 64k tokens. Clef es el modelo de precisión de 27B y Clef-Flash es el modelo de latencia de 9B, entrenado a partir de Qwen3.5-9B. Ninguno necesita un servicio de visión independiente a su lado.

Así que cuando llega la foto de un paquete dañado, el modelo no te dice lo que ve. Responde a las preguntas que hiciste —si está dañado, con qué gravedad, en qué zona—, cada una con su probabilidad, en una sola llamada.

El codificador de visión forma parte del modelo base

Este es el detalle que cambia la forma de desplegar el sistema. El codificador de visión no es un adaptador pegado a un checkpoint solo de texto, ni un modelo aparte que convierte la imagen en palabras antes de que empiece el modelo real. Forma parte del modelo base y se entrena junto con la ruta de razonamiento.

Como va integrado, los estados de imagen y los de texto recorren los mismos pesos, la misma interfaz y el mismo despliegue. No mantienes un segundo endpoint para entradas visuales ni una capa de enrutado que decide a qué modelo llamar según el tipo de entrada.

Eso mantiene pequeña la superficie operativa. Un modelo, un formato de esquema y un único sitio donde mirar cuando algo se comporta de forma distinta a la esperada.

Estados que son imágenes o fotogramas

El estado es la materia prima de una decisión. En un flujo de texto puede ser un ticket de soporte o una línea de registro. En un flujo visual es una fotografía, una captura de pantalla, un escaneo, una imagen de producto o un fotograma extraído de un vídeo.

El vídeo es simplemente una secuencia de estados. Muestreas fotogramas con el intervalo que necesite tu problema y puntúas cada uno frente al mismo esquema. Un clip de diez minutos a un fotograma por segundo son seiscientas decisiones, todas estructuradas y todas comparables entre sí.

El estado no tiene que ser una imagen de estudio bien encuadrada. Las capturas de interfaces, las imágenes de paneles y los fotogramas de cámara funcionan igual, porque el codificador aprende a leer la señal en lugar de exigir un encuadre concreto.

Un esquema de preguntas tipadas se aplica a estados visuales

El esquema no cambia solo porque el estado sea visual. Una pregunta tipada sigue restringiendo la respuesta. Una pregunta de enumeración enumera las etiquetas exactas entre las que el modelo puede elegir. Una pregunta booleana es una división en dos. Una pregunta de número acotado espera un valor dentro de un rango que tú defines.

Para la foto de una estantería podrías preguntar si el producto está en stock, cuántas caras son visibles dentro de un rango y a qué categoría pertenece la estantería. Cada una es una pregunta tipada con un espacio finito de respuestas, y el modelo devuelve una probabilidad por cada opción permitida.

La restricción es lo que hace que el resultado sea seguro de consumir. El modelo no puede inventar una cuarta categoría ni devolver un recuento fuera del rango, así que el código posterior puede confiar en la forma de la respuesta antes de mirar una sola probabilidad.

Dónde merece la pena decidir sobre lo visual

La respuesta a preguntas visuales rara vez necesita prosa. Necesita una etiqueta, una decisión de enrutado o un umbral, y eso es exactamente lo que produce un modelo de decisión. La misma llamada puede disparar una alerta, asignar una cola o marcar una revisión humana.

La moderación es el caso evidente: un fotograma se permite, se manda a revisión o se bloquea, y la probabilidad indica cuán ajustada fue la decisión. La inspección es la versión industrial, donde la foto de una pieza se puntúa por tipo de defecto y gravedad sin escribir jamás una descripción.

El triaje de fotogramas es donde más importa el rendimiento. Una grabación larga contiene sobre todo fotogramas sin incidencias, así que puntúas cada fotograma muestreado a bajo coste y conservas solo los que cruzan un umbral para una atención más profunda.

  • Control de calidad visual: enviar la captura de una interfaz o un producto a la cola correcta.
  • Moderación: permitir, revisar o bloquear un fotograma.
  • Inspección: tipo y gravedad de defecto a partir de una sola foto.
  • Triaje de fotogramas: conservar solo los momentos que cruzan un umbral.

Por qué puntuar en una pasada importa para el vídeo

El vídeo lo multiplica todo. Un flujo que puntúa una imagen por petición puede permitirse un modelo tranquilo, pero un flujo que puntúa cientos de fotogramas por emisión no. La latencia por fotograma se acumula directamente en cuánto se queda atrás el flujo respecto al tiempo real.

Un modelo de decisión puntúa todas las opciones permitidas a la vez en una única pasada hacia delante, en lugar de generar un token cada vez. Clef-Flash se creó para este tipo de trabajo. Las cifras publicadas sitúan su latencia mediana en torno a 39 ms y su p95 cerca de 122 ms, con un precio de entrada reportado cercano a 0,09 dólares por millón de tokens y un rendimiento reportado de más de diez veces la velocidad de Jev en tareas comparables.

Como el conjunto de opciones se puntúa a partir de una única evaluación de un único fotograma, las probabilidades siguen siendo comparables fotograma a fotograma. Esa coherencia es lo que te permite fijar un umbral global en lugar de recalibrar para cada imagen nueva que llega.

Contexto de 64k y varios fotogramas

Ambos modelos admiten un contexto de 64k tokens, suficiente para llevar varios fotogramas junto a instrucciones de texto en la misma petición. Puedes puntuar una secuencia corta en lugar de un fotograma aislado, lo que ayuda cuando la decisión depende del movimiento o del cambio entre fotogramas.

Aquí hay un intercambio real. Las imágenes consumen tokens, así que más fotogramas o más resolución significa menos de ambos. Tú decides cómo gastar el presupuesto: unos pocos fotogramas detallados o muchos y de baja resolución a lo largo de una ventana más amplia.

Un patrón práctico es muestrear los fotogramas de forma deliberada, agrupar unos pocos por petición y mantener el esquema idéntico en todo el grupo para que las respuestas encajen al agregarlas.

El mismo esquema para estados de texto y de imagen

Una de las ventajas más silenciosas de un codificador integrado es que los estados de texto y de imagen comparten esquema. Una rúbrica de moderación escrita para texto se traslada a una captura de pantalla sin reescribirse, y las mismas preguntas se ejecutan sobre ambos tipos de entrada.

Esto permite unificar lo que de otro modo serían dos flujos. Un proceso de soporte puede leer una reclamación escrita y una captura de la pantalla que falla con las mismas preguntas tipadas, y luego combinar las probabilidades en una única decisión de enrutado.

También significa que no hay reentrenamiento cuando aparece un tipo de entrada nuevo. Describes el nuevo estado en la petición y reutilizas el esquema que ya tienes, así que la lógica de la aplicación no se bifurca solo porque la entrada cambie de forma.

En qué se diferencia de describir imágenes o del chat con visión

Un modelo de descripción convierte una imagen en una frase. Esa frase se lee bien y es casi imposible de umbralizar. La señal que te importa queda enterrada en la elección de palabras, y la forma del resultado cambia con cada imagen.

Un modelo de chat con visión responde a preguntas abiertas en prosa. Es flexible, pero las respuestas son difíciles de comparar, difíciles de auditar y fáciles de contradecir. Ninguno de los dos enfoques da al código de aplicación un espacio fijo de respuestas en el que confiar.

Un modelo de decisión multimodal se compromete con ese espacio de respuestas de antemano. Puntúa el fotograma frente a tus preguntas tipadas y devuelve un número por cada opción, que es la diferencia entre describir una imagen y decidir sobre ella.

Cómo probarlo

La forma más rápida de verlo funcionando es usarlo. El playground te deja aportar un estado, añadir preguntas tipadas y leer la probabilidad de cada opción permitida en una sola pantalla, sin configuración y sin complicaciones de cuenta.

Si prefieres ejecutarlo tú mismo, Clef-Flash está disponible a través de Ollama con un solo comando de descarga, y la documentación cubre la forma de la petición y de la respuesta para ambos modelos. Workers AI, Hugging Face y OpenRouter son las otras vías de distribución.

Empieza con una pregunta visual que de verdad necesites responder, define sus opciones de forma estricta y observa cuánto más simple es el resultado que cualquier descripción.

Pruébalo aquí

Ejecuta esto en el modelo

Pega tu propio estado abajo y define una pregunta tipada. El marco es la demo en vivo de Clef-Flash; el panel de la página del playground llama a la API directamente.

Clef-Flash community-hosted

Community-hosted demo of the 9B model. Runs live in your browser session.

Preguntas frecuentes

¿Un modelo de decisión multimodal describe la imagen?

No. No describe la imagen ni conversa sobre ella. Puntúa la imagen frente a un esquema de preguntas tipadas y devuelve una probabilidad por cada opción permitida en una sola pasada.

¿El codificador de visión se añade sobre Clef-Flash?

No. Forma parte del modelo base y se entrena junto con la ruta de razonamiento, así que los estados de imagen y de texto usan los mismos pesos, la misma interfaz y el mismo despliegue.

¿Puedo puntuar un vídeo con él?

Sí. Un vídeo es una secuencia de fotogramas, y cada fotograma muestreado es un estado. Puntúalos frente al mismo esquema y las probabilidades seguirán siendo comparables en todo el flujo.

¿Necesito un esquema distinto para imágenes que para texto?

No. Las preguntas tipadas funcionan igual en ambos casos, lo que permite que un solo flujo maneje una reclamación escrita y una captura de pantalla con el mismo espacio de respuestas.