run clef flash locally

Ejecutar Clef-Flash en local

Clef-Flash es de pesos abiertos bajo Apache 2.0, así que el autoalojamiento es una opción legítima. Esto es lo que cuesta en hardware y cómo ponerlo en marcha.

Un solo comando con Ollama

Ollama publica el modelo, lo que hace trivial la primera ejecución. Descárgalo y envía un estado con un esquema de preguntas tipadas; el modelo devuelve probabilidades.

  • Instala Ollama para tu plataforma.
  • Ejecuta: ollama pull clef-flash
  • Envía un estado más un esquema JSON de preguntas tipadas y lee las probabilidades devueltas.

El hardware que realmente necesitas

El requisito publicado es de al menos 41 GB de VRAM de GPU para Clef-Flash con concurrencia única y el contexto completo de 64k. El modelo Clef de 27B necesita unos 85 GB. Los usuarios de Apple silicon pueden apoyarse en las conversiones MLX de 4 bits de la comunidad en Hugging Face, que sacrifican un poco de precisión a cambio de un espacio mucho menor.

Si solo tienes una GPU de consumo, las compilaciones cuantizadas de la comunidad o un endpoint alojado son las vías prácticas. La precisión completa requiere una tarjeta seria.

Cuándo tiene sentido el autoalojamiento

Autoaloja cuando los datos no puedan salir de tu infraestructura, cuando el volumen sea lo bastante alto como para que el precio por token domine el coste del hardware, o cuando necesites ajustar el modelo con tus propias etiquetas. La publicación de Cloudflare incluye ajuste fino por aprendizaje por refuerzo, dirigido precisamente a ese último caso.

Alójalo cuando lo necesites funcionando hoy, cuando el tráfico sea irregular o cuando el volumen de decisiones no justifique una GPU.

Un camino intermedio

Puedes mantener el prototipo en el playground de este sitio y pasar a un endpoint alojado cuando salgas a producción, sin cambiar la forma de la solicitud: el contrato de estado más esquema es el mismo en todas partes.

Preguntas frecuentes

¿Clef-Flash funciona en un portátil?

No a precisión completa. Necesita unos 41 GB de VRAM de GPU. Existen compilaciones cuantizadas de la comunidad para Apple silicon y tarjetas más pequeñas, y los endpoints alojados son más baratos que comprar hardware para un uso ocasional.

¿Cuál es el comando de Ollama?

ollama pull clef-flash. La variante de 27B está disponible como ollama pull clef.

¿Puedo ajustarlo con mis datos?

Sí. Los pesos son Apache 2.0 y Cloudflare publicó una vía de ajuste fino por RL, así que puedes entrenarlo con tus propias decisiones.

Sigue leyendo

Notas del modelo

Un correo corto cuando salga un nuevo modelo de decisión o cambie un benchmark. Sin spam, baja en un clic.