Convierte cualquier estado en una decisión, en una sola pasada
Clef-Flash es un modelo de decisión multimodal de 9B. Dale una situación y un esquema de preguntas tipadas; devuelve una probabilidad para cada respuesta permitida. Sin chat, sin ingeniería de prompts, unos 39 ms de mediana.
Community-hosted demo of the 9B model. Runs live in your browser session.
Cómo funciona un modelo de decisión
Tres pasos, una petición. Si tu prompt termina con «responde con una de estas opciones», este es el modelo que se construyó para eso.
Describe el estado
Pega un ticket de soporte, un JSON, la descripción de un producto o la referencia de una imagen. El estado es la situación sobre la que el modelo razona, hasta 64k tokens.
Enumera las respuestas permitidas
Escribe preguntas tipadas, cada una con un conjunto cerrado de opciones. El esquema es el contrato: el modelo no puede responder fuera de él, así que no hay nada que parsear.
Lee la distribución
Cada pregunta vuelve con una probabilidad por opción y una respuesta ganadora. Aplica un umbral a la confianza, registra el resto y deja de escribir expresiones regulares sobre texto generado.
Modelo de decisión frente a LLM
La misma entrada, un contrato distinto. Esta es la distinción que decide tu arquitectura.
| Large language model | Clef-Flash | |
|---|---|---|
| Salida | Texto libre que hay que parsear | Una probabilidad por opción permitida |
| Forma | Abierta; el formato se desvía | Conjunto cerrado, garantizado por el esquema |
| Coste de un error | Un parser roto en producción | Una confianza baja sobre la que aplicar un umbral |
| Mejor en | Escribir, explicar, extraer | Enrutar, etiquetar, puntuar, moderar |
Para qué lo usa la gente
En cualquier punto donde un sistema deba elegir entre opciones acotadas antes de que un humano vea la cola.
Enrutado de herramientas
Elige la siguiente herramienta de un catálogo fijo antes de que el agente gaste un token deliberando.
Triaje de soporte
Etiqueta intención y urgencia, y enruta según la confianza en lugar de adivinar.
Moderación de contenido
Devuelve una categoría y una probabilidad que puedas defender después.
Etiquetado de imágenes
El codificador de visión toma una imagen como estado, así que el mismo esquema sirve para fotos.
Puntuación de leads
Bandas acotadas en lugar de un número que el modelo se inventó esta vez.
Barreras de calidad
Aprobar, rechazar o escalar, registrando la distribución para su revisión.
Los datos, antes del discurso
- Dos modelos: Clef 27B para precisión, Clef-Flash 9B para latencia. Ambos con pesos abiertos y licencia Apache 2.0.
- Clef-Flash se entrena a partir de Qwen3.5-9B, con codificador de visión y una ventana de 64k.
- La latencia publicada de Clef-Flash es de unos 39 ms de mediana y 122 ms en el percentil 95, más de diez veces más rápido que Jev en tareas comparables.
- La inferencia local necesita unos 41 GB de VRAM para Clef-Flash y unos 85 GB para el modelo Clef de 27B. Ambos están en Ollama.
- Disponible en Cloudflare Workers AI, Ollama, Hugging Face y OpenRouter.
Las primeras preguntas
¿Este sitio es Cloudflare?
No. Es un playground independiente. Clef y Clef-Flash son modelos de código abierto de Cloudflare, publicados bajo licencia Apache 2.0, y este sitio no está afiliado a ellos.
¿Qué diferencia hay entre Clef y Clef-Flash?
Clef es el modelo de precisión de 27B; Clef-Flash es el modelo de latencia de 9B. Empieza por Clef-Flash y pasa al modelo grande solo las preguntas que falle.
¿Necesito una cuenta para probarlo?
No. El playground funciona sin registro. Una clave de API solo amplía la cuota diaria de decisiones.
¿Guardáis el texto que pego?
Guardamos el recuento, el modelo y la latencia, no el estado en sí. La política de privacidad detalla exactamente qué se conserva.
Guías para quien construye
¿Qué es un modelo de decisión? Probabilidades tipadas en lugar de chat
Un modelo de decisión recibe un estado y un esquema de preguntas tipadas, y devuelve una probabilidad para cada opción permitida en una sola pasada, sin chat ni prosa.
Rendimiento de Clef-Flash: latencia, coste y memoria explicados
Clef-Flash se reporta con unos 39 ms de latencia mediana, 122 ms de p95 y 0,09 dólares por millón de tokens de entrada: esto significa cada cifra publicada.
Cómo ejecutar Clef-Flash en Ollama
Clef-Flash se distribuye como modelo de Ollama: descárgalo, escribe un esquema de preguntas tipadas y lee una probabilidad por opción permitida sin salir de tu máquina.
Abrir el playground
Ejecuta un estado en Clef-Flash ahora mismo. Nada que instalar, sin cuenta.
Notas del modelo
Un correo corto cuando salga un nuevo modelo de decisión o cambie un benchmark. Sin spam, baja en un clic.