Clef-Flash, el modelo de decisión de 9B que responde en lugar de conversar
Clef-Flash convierte un estado y un esquema de preguntas tipadas en decisiones: una probabilidad para cada opción permitida, en una sola pasada. Alrededor de 39 ms de mediana, pesos Apache 2.0, contexto de 64k y visión integrada.
Qué es realmente Clef-Flash
Clef-Flash es el más pequeño de los dos modelos de decisión que Cloudflare publicó el 1 de octubre de 2026. Es un modelo multimodal de 9 mil millones de parámetros, ajustado a partir de Qwen3.5-9B, y no es un chatbot. Dado un estado —texto, JSON, una imagen o fotogramas de vídeo— y un esquema de preguntas tipadas, devuelve una probabilidad para cada respuesta permitida.
Esa forma es justamente lo importante. Un clasificador quiere una etiqueta; un enrutador quiere un destino; un revisor quiere un veredicto con una puntuación de confianza. Clef-Flash devuelve exactamente eso, en una pasada, sin un segundo paso de análisis y sin un prompt que intente convencer a un modelo de lenguaje de que actúe como un clasificador.
- 9B parámetros, con codificador de visión incluido.
- Ventana de contexto de 64k tokens.
- Licencia Apache 2.0, pesos abiertos.
- Respuestas tipadas con probabilidades, en una sola pasada.
Qué tan rápido es y cuánto cuesta
Las cifras de referencia publicadas sitúan a Clef-Flash en unos 39 ms de latencia mediana y 122 ms en el p95, lo que lo hace más de diez veces más rápido que Jev en las mismas tareas de decisión. Los tokens de entrada cuestan alrededor de $0.09 por millón cuando se llama a través de un proveedor alojado.
La velocidad no es una nota de marketing. Es lo que saca a un modelo de decisión de un proceso por lotes sin conexión y lo lleva a la ruta de la solicitud: un agente que enruta llamadas a herramientas, una puerta de moderación, un paso de triaje de tickets de soporte que debe terminar antes de que una persona vea la cola.
Dónde puedes ejecutarlo
Clef-Flash está disponible en Cloudflare Workers AI, a través de Ollama con un solo comando de descarga, en Hugging Face, incluidas las conversiones MLX de 4 bits de la comunidad, y en OpenRouter. La inferencia local necesita al menos 41 GB de VRAM de GPU; el modelo Clef de 27B, más grande, necesita unos 85 GB.
- Alojado: Workers AI, OpenRouter.
- Local: ollama pull clef-flash.
- Apple silicon: compilaciones MLX de 4 bits de la comunidad en Hugging Face.
- Este sitio: un playground de la comunidad integrado y una API alojada.
Pruébalo antes de leer otro párrafo
El playground de este sitio integra una demo en vivo de Clef-Flash creada por la comunidad, para que puedas pegar un estado y definir preguntas en el navegador. No se instala nada, no se almacena nada y el modelo se ejecuta en otro lugar.
Si quieres el mismo comportamiento en tu propio stack, la página de la API muestra la forma de la solicitud y la página de precios muestra los niveles alojados.
Preguntas frecuentes
¿Clef-Flash es gratis?
Los pesos son Apache 2.0, así que el modelo en sí se puede descargar y autoalojar gratis. La inferencia alojada la factura el proveedor que uses. Este sitio te permite probarlo gratis en el navegador.
¿En qué se diferencia Clef-Flash de un LLM normal?
Un modelo de lenguaje genera texto y tú lo analizas. Clef-Flash devuelve directamente una probabilidad para cada opción permitida, así que no hay nada que analizar y no puede responder fuera del esquema que le diste.
¿Cuánta VRAM necesita Clef-Flash?
Unos 41 GB para inferencia local con concurrencia única y un contexto de 64k. El modelo Clef de 27B, más grande, necesita unos 85 GB. Si eso está fuera de tu alcance, usa un endpoint alojado.
¿Cuál es la diferencia entre Clef y Clef-Flash?
Clef es el modelo de precisión de 27B; Clef-Flash es el modelo de latencia de 9B. Elige Clef cuando la precisión en decisiones difíciles importe más que la velocidad, y Clef-Flash cuando la decisión esté en la ruta de una solicitud.
Sigue leyendo
Notas del modelo
Un correo corto cuando salga un nuevo modelo de decisión o cambie un benchmark. Sin spam, baja en un clic.