ai moderation api

API de moderación con IA: probabilidades en lugar de un veredicto opaco

Una API de moderación con IA debería devolver probabilidades por etiqueta, no un único veredicto, para que tu equipo controle el umbral que decide qué se bloquea.

Por qué un veredicto binario no basta

La mayoría de los endpoints de moderación responden a una sola pregunta: esto está permitido o no. Parece simple hasta que tienes que explicar una decisión a un usuario o ajustarla para una comunidad concreta.

Un único veredicto esconde los casos que más importan. El contenido límite, la sátira, el discurso citado y las publicaciones que dependen del contexto acaban todos aplanados en el mismo sí o no, y no tienes ninguna palanca para ajustarlo sin cambiar de proveedor.

Una API de moderación con IA construida sobre un modelo de decisión devuelve en cambio el cuadro completo: una probabilidad por cada etiqueta que definas, en una sola pasada, de modo que el umbral vive en tu código y no en la caja negra de otro.

Las apelaciones lo dejan claro. Cuando un creador impugna una retirada, una distribución de probabilidad te permite mostrar qué señales eran débiles y cuánto, algo mucho más defendible que señalar una etiqueta opaca.

La forma de una decisión de moderación

Un modelo de decisión lee un estado —la publicación, el comentario, el pie de foto o la imagen— junto con un esquema de preguntas tipadas, y devuelve una probabilidad para cada opción permitida. No redacta un dictamen en prosa.

Clef y Clef-Flash son los modelos de decisión de código abierto que hay detrás de este enfoque, publicados por Cloudflare bajo Apache 2.0. Clef es el modelo de precisión de 27B; Clef-Flash es el modelo de latencia de 9B. Ambos manejan un contexto de 64k tokens e incluyen un codificador de visión.

Para la moderación, el esquema suele ser una enumeración de acciones como permitir, revisar y bloquear, más las preguntas tipadas adicionales que quieras responder al mismo tiempo.

Permitir, revisar y bloquear como probabilidades

En lugar de un único veredicto recibes tres números. Una puntuación de 0,88 para revisar, 0,09 para permitir y 0,03 para bloquear cuenta una historia muy distinta de la de una publicación que puntúa 0,55, 0,40 y 0,05.

Ese detalle te permite construir una respuesta graduada. El contenido claramente aceptable se publica de inmediato, el claramente dañino se bloquea, y el término medio ambiguo va a una cola humana con su distribución adjunta.

Como las probabilidades proceden de una única evaluación del mismo estado, son comparables entre sí, algo que un conjunto de respuestas independientes en prosa nunca sería.

Los umbrales son política, no modelo

La consecuencia útil es que la línea entre bloquear y revisar la trazas tú. Una plataforma infantil puede fijar un corte más estricto que un foro para desarrolladores, usando el mismo modelo y el mismo esquema.

Cambiar esa política es un cambio de configuración y no un trabajo de reentrenamiento. Cuando aparece un tipo nuevo de abuso, ajustas el umbral o añades una categoría, y puedes publicar la actualización el mismo día.

También puedes mantener umbrales distintos por superficie, de modo que los comentarios, los mensajes directos y las publicaciones públicas reciban cada uno la sensibilidad que merecen sin ejecutar modelos diferentes.

Esto es también lo que hace que el enfoque sea comprobable. Puedes reproducir el contenido del mes pasado con un umbral nuevo y ver exactamente cuántos elementos pasarían de permitir a revisar, o de revisar a bloquear, antes de que ninguna política entre en vigor.

Varias etiquetas en una sola pasada

La moderación rara vez es una sola pregunta. Puede que necesites una categoría, una gravedad y una acción recomendada, todo para el mismo elemento.

Un modelo de decisión responde a todas ellas a partir de una única lectura del estado. Envías un esquema con una enumeración para la categoría, un número acotado para la gravedad y una enumeración para la acción recomendada.

Las respuestas llegan juntas y se mantienen coherentes, porque se puntuaron a partir de una sola interpretación y no de tres llamadas independientes que pueden contradecirse.

La coherencia también elimina un modo de fallo sutil. Cuando la categoría y la acción las deciden llamadas distintas, un modelo puede etiquetar algo como claramente dañino y luego recomendar permitirlo, porque la segunda llamada nunca vio la primera respuesta.

La gravedad como número acotado

No toda decisión es una etiqueta. La gravedad es naturalmente un número, y una pregunta tipada puede acotarla a un rango para que el modelo no pueda devolver un valor fuera de él.

Una puntuación de gravedad te permite ordenar la cola de revisión humana, de modo que los moderadores vean primero los elementos más dañinos en lugar de un montón desordenado.

También te permite expresar la política de escalado con aritmética simple: bloquear por encima de un corte, encolar por encima de otro más bajo y dejar pasar el resto.

Texto, JSON e imágenes a la vez

La moderación moderna tiene que ver más que texto. Una publicación suele ser una imagen, un pie de foto y metadatos estructurados al mismo tiempo.

Clef y Clef-Flash incluyen un codificador de visión en el modelo base y no como un añadido, así que la misma petición puede llevar una captura de pantalla, un documento y un registro JSON sin una tubería aparte.

Esa única interfaz mantiene pequeña la pila de moderación, algo que importa cuando hay que razonar sobre los modos de fallo y auditar cómo se llegó a una decisión.

Latencia y coste a escala de moderación

La moderación se ejecuta sobre cada pieza de contenido de usuario, así que la latencia y el precio deciden si un enfoque es viable. Clef-Flash se creó para trabajo crítico en latencia: las cifras publicadas sitúan su latencia mediana en torno a 39 ms y su p95 cerca de 122 ms, con un precio de entrada reportado cercano a 0,09 dólares por millón de tokens.

Se ejecuta con unos 41 GB de VRAM en local, mientras que Clef necesita unos 85 GB, así que el modelo de latencia cabe con holgura en un acelerador para los equipos que deben mantener el contenido de usuario dentro de su propio perímetro.

Ambos modelos se distribuyen a través de Workers AI, Ollama, Hugging Face y OpenRouter, así que un equipo puede empezar alojado y pasar a un despliegue local, o al revés, sin cambiar el esquema.

Construir la cola de revisión humana

Una salida probabilística convierte una cola de revisión en algo que puedes priorizar en lugar de solo poblar. Ordena por la puntuación de bloqueo, agrupa por categoría y muestra la distribución junto a cada elemento.

Los revisores pueden entonces confirmar o revertir decisiones, y esos resultados te permiten medir si tus umbrales están donde crees que están.

Como las reglas de enrutado viven en tu código, endurecerlas o relajarlas tras un ciclo de revisión es una solicitud de cambio normal y no una conversación con un proveedor.

Con el tiempo, la cola se convierte en un conjunto de datos etiquetado como efecto secundario, y puedes usarla para comprobar si un umbral distinto habría servido mejor a tu comunidad.

Empieza a puntuar tu contenido

La forma más rápida de ver cómo se comporta con tu propio material es pegar una muestra en el playground, definir permitir, revisar y bloquear, y leer las probabilidades directamente.

La página de la API de clasificación describe la petición y la respuesta en detalle, y la página de precios expone cuánto cuesta una llamada alojada antes de integrar nada.

Pruébalo aquí

Ejecuta esto en el modelo

Pega tu propio estado abajo y define una pregunta tipada. El marco es la demo en vivo de Clef-Flash; el panel de la página del playground llama a la API directamente.

Clef-Flash community-hosted

Community-hosted demo of the 9B model. Runs live in your browser session.

Preguntas frecuentes

¿En qué se diferencia una API de moderación probabilística de una API de veredicto?

Una API de veredicto devuelve una única decisión de bloqueo o permiso. Una API probabilística devuelve una puntuación por etiqueta, así que eliges tú el umbral y puedes enrutar los casos límite a revisión humana.

¿Puedo moderar imágenes además de texto?

Sí. Clef y Clef-Flash incluyen un codificador de visión, así que la misma petición puede llevar texto, JSON e imágenes sin construir una tubería aparte.

¿Tengo que entrenar mi propio modelo de moderación?

No. Las categorías se definen en el esquema que envías con cada petición, así que si la política cambia cambias el esquema en lugar de reentrenar un modelo.

¿Es lo bastante rápida una API de moderación con modelo de decisión para tráfico en vivo?

Clef-Flash está pensado para trabajo crítico en latencia, con una latencia mediana publicada cerca de 39 ms y un p95 cerca de 122 ms, y un precio de entrada reportado cercano a 0,09 dólares por millón de tokens.