Por qué un veredicto binario no basta
La mayoría de los endpoints de moderación responden a una sola pregunta: esto está permitido o no. Parece simple hasta que tienes que explicar una decisión a un usuario o ajustarla para una comunidad concreta.
Un único veredicto esconde los casos que más importan. El contenido límite, la sátira, el discurso citado y las publicaciones que dependen del contexto acaban todos aplanados en el mismo sí o no, y no tienes ninguna palanca para ajustarlo sin cambiar de proveedor.
Una API de moderación con IA construida sobre un modelo de decisión devuelve en cambio el cuadro completo: una probabilidad por cada etiqueta que definas, en una sola pasada, de modo que el umbral vive en tu código y no en la caja negra de otro.
Las apelaciones lo dejan claro. Cuando un creador impugna una retirada, una distribución de probabilidad te permite mostrar qué señales eran débiles y cuánto, algo mucho más defendible que señalar una etiqueta opaca.
La forma de una decisión de moderación
Un modelo de decisión lee un estado —la publicación, el comentario, el pie de foto o la imagen— junto con un esquema de preguntas tipadas, y devuelve una probabilidad para cada opción permitida. No redacta un dictamen en prosa.
Clef y Clef-Flash son los modelos de decisión de código abierto que hay detrás de este enfoque, publicados por Cloudflare bajo Apache 2.0. Clef es el modelo de precisión de 27B; Clef-Flash es el modelo de latencia de 9B. Ambos manejan un contexto de 64k tokens e incluyen un codificador de visión.
Para la moderación, el esquema suele ser una enumeración de acciones como permitir, revisar y bloquear, más las preguntas tipadas adicionales que quieras responder al mismo tiempo.
Permitir, revisar y bloquear como probabilidades
En lugar de un único veredicto recibes tres números. Una puntuación de 0,88 para revisar, 0,09 para permitir y 0,03 para bloquear cuenta una historia muy distinta de la de una publicación que puntúa 0,55, 0,40 y 0,05.
Ese detalle te permite construir una respuesta graduada. El contenido claramente aceptable se publica de inmediato, el claramente dañino se bloquea, y el término medio ambiguo va a una cola humana con su distribución adjunta.
Como las probabilidades proceden de una única evaluación del mismo estado, son comparables entre sí, algo que un conjunto de respuestas independientes en prosa nunca sería.
Los umbrales son política, no modelo
La consecuencia útil es que la línea entre bloquear y revisar la trazas tú. Una plataforma infantil puede fijar un corte más estricto que un foro para desarrolladores, usando el mismo modelo y el mismo esquema.
Cambiar esa política es un cambio de configuración y no un trabajo de reentrenamiento. Cuando aparece un tipo nuevo de abuso, ajustas el umbral o añades una categoría, y puedes publicar la actualización el mismo día.
También puedes mantener umbrales distintos por superficie, de modo que los comentarios, los mensajes directos y las publicaciones públicas reciban cada uno la sensibilidad que merecen sin ejecutar modelos diferentes.
Esto es también lo que hace que el enfoque sea comprobable. Puedes reproducir el contenido del mes pasado con un umbral nuevo y ver exactamente cuántos elementos pasarían de permitir a revisar, o de revisar a bloquear, antes de que ninguna política entre en vigor.
Varias etiquetas en una sola pasada
La moderación rara vez es una sola pregunta. Puede que necesites una categoría, una gravedad y una acción recomendada, todo para el mismo elemento.
Un modelo de decisión responde a todas ellas a partir de una única lectura del estado. Envías un esquema con una enumeración para la categoría, un número acotado para la gravedad y una enumeración para la acción recomendada.
Las respuestas llegan juntas y se mantienen coherentes, porque se puntuaron a partir de una sola interpretación y no de tres llamadas independientes que pueden contradecirse.
La coherencia también elimina un modo de fallo sutil. Cuando la categoría y la acción las deciden llamadas distintas, un modelo puede etiquetar algo como claramente dañino y luego recomendar permitirlo, porque la segunda llamada nunca vio la primera respuesta.
La gravedad como número acotado
No toda decisión es una etiqueta. La gravedad es naturalmente un número, y una pregunta tipada puede acotarla a un rango para que el modelo no pueda devolver un valor fuera de él.
Una puntuación de gravedad te permite ordenar la cola de revisión humana, de modo que los moderadores vean primero los elementos más dañinos en lugar de un montón desordenado.
También te permite expresar la política de escalado con aritmética simple: bloquear por encima de un corte, encolar por encima de otro más bajo y dejar pasar el resto.
Texto, JSON e imágenes a la vez
La moderación moderna tiene que ver más que texto. Una publicación suele ser una imagen, un pie de foto y metadatos estructurados al mismo tiempo.
Clef y Clef-Flash incluyen un codificador de visión en el modelo base y no como un añadido, así que la misma petición puede llevar una captura de pantalla, un documento y un registro JSON sin una tubería aparte.
Esa única interfaz mantiene pequeña la pila de moderación, algo que importa cuando hay que razonar sobre los modos de fallo y auditar cómo se llegó a una decisión.
Latencia y coste a escala de moderación
La moderación se ejecuta sobre cada pieza de contenido de usuario, así que la latencia y el precio deciden si un enfoque es viable. Clef-Flash se creó para trabajo crítico en latencia: las cifras publicadas sitúan su latencia mediana en torno a 39 ms y su p95 cerca de 122 ms, con un precio de entrada reportado cercano a 0,09 dólares por millón de tokens.
Se ejecuta con unos 41 GB de VRAM en local, mientras que Clef necesita unos 85 GB, así que el modelo de latencia cabe con holgura en un acelerador para los equipos que deben mantener el contenido de usuario dentro de su propio perímetro.
Ambos modelos se distribuyen a través de Workers AI, Ollama, Hugging Face y OpenRouter, así que un equipo puede empezar alojado y pasar a un despliegue local, o al revés, sin cambiar el esquema.
Construir la cola de revisión humana
Una salida probabilística convierte una cola de revisión en algo que puedes priorizar en lugar de solo poblar. Ordena por la puntuación de bloqueo, agrupa por categoría y muestra la distribución junto a cada elemento.
Los revisores pueden entonces confirmar o revertir decisiones, y esos resultados te permiten medir si tus umbrales están donde crees que están.
Como las reglas de enrutado viven en tu código, endurecerlas o relajarlas tras un ciclo de revisión es una solicitud de cambio normal y no una conversación con un proveedor.
Con el tiempo, la cola se convierte en un conjunto de datos etiquetado como efecto secundario, y puedes usarla para comprobar si un umbral distinto habría servido mejor a tu comunidad.
Empieza a puntuar tu contenido
La forma más rápida de ver cómo se comporta con tu propio material es pegar una muestra en el playground, definir permitir, revisar y bloquear, y leer las probabilidades directamente.
La página de la API de clasificación describe la petición y la respuesta en detalle, y la página de precios expone cuánto cuesta una llamada alojada antes de integrar nada.