clef vs clef flash

Clef vs Clef-Flash: elige precisión o elige latencia

La misma familia, la misma forma de solicitud y dos presupuestos muy distintos. Clef es el modelo de 27B para decisiones difíciles; Clef-Flash es el modelo de 9B para decisiones que no deben ralentizar una solicitud.

Los dos modelos, lado a lado

Ambos modelos aceptan un estado y un esquema de preguntas tipadas y devuelven probabilidades. La diferencia está en dónde se sitúan en la curva de precisión frente a latencia y en cuánto hardware necesitan.

  • Clef — 27B parámetros, mayor precisión, unos 85 GB de VRAM en local.
  • Clef-Flash — 9B parámetros ajustados a partir de Qwen3.5-9B, unos 39 ms de mediana, unos 41 GB de VRAM en local.
  • Ambos — Apache 2.0, contexto de 64k, codificador de visión.

Cuándo los 18 mil millones de parámetros extra valen la pena

Recurre a Clef cuando la decisión sea realmente difícil: estados ambiguos, distinciones sutiles, casos en los que una respuesta errónea resulta cara y el presupuesto de latencia es de segundos y no de milisegundos. La puntuación por lotes, la revisión sin conexión, el triaje de contratos y el enrutamiento complejo encajan aquí.

Recurre a Clef-Flash cuando la decisión esté en la ruta de la solicitud: selección de herramientas de un agente, moderación en vivo, enrutamiento de tickets, cualquier cosa en la que 39 ms frente a unos pocos cientos de milisegundos cambie lo que puedes construir.

El valor predeterminado honesto: haz el prototipo con Clef-Flash. Pasa a Clef solo las preguntas concretas que falla, en lugar de pasarlo todo.

Ejecutar ambos

Ollama publica ambos modelos, así que cambiar en local está a un comando de descarga. En infraestructura alojada, los dos son endpoints separados con precios separados, y el modelo más grande cuesta más por token porque es más caro de servir.

Compáralos con tus propios datos

Este sitio integra un playground de la comunidad para cada modelo, en su propia página. Ejecutar el mismo estado en ambos, lado a lado, es la única referencia que importa para tus datos.

Preguntas frecuentes

¿Con qué modelo Clef debería empezar?

Empieza con Clef-Flash. Es más rápido, más barato y suficiente para la mayoría de las decisiones acotadas. Pasa solo las preguntas que falla al modelo Clef de 27B.

¿Ambos modelos usan la misma forma de API?

Sí. Ambos toman un estado más preguntas tipadas y devuelven probabilidades por opción permitida, así que cambiar de uno a otro no requiere reescribir el código.

¿Qué hardware necesitan en local?

Clef-Flash necesita unos 41 GB de VRAM de GPU y el modelo Clef de 27B unos 85 GB con concurrencia única y un contexto de 64k.

Sigue leyendo

Notas del modelo

Un correo corto cuando salga un nuevo modelo de decisión o cambie un benchmark. Sin spam, baja en un clic.