Lo que hemos medido
Todas las mediciones, no solo la mejor, y lo que se le escapó al revisor.
En corto
- Un modelo de inteligencia artificial no se puede probar como una calculadora. Se mide con casos armados de antemano, y el resultado se guarda.
- Aquí está cada medición hecha hasta hoy, con su fecha y el modelo, incluidas las que salieron peor y las que dejaron pasar un error.
- Son pocos casos y todos de prueba. Sirven para ver si el sistema se sostiene, no para prometer un resultado.
El revisor: ¿detecta un texto con un error puesto a propósito?
Antes de que una persona vea un texto, un agente revisor lo compara con el documento de la marca. Para medirlo se le dan textos buenos y textos con un error puesto a propósito (una afirmación sin respaldo, un precio equivocado, una palabra prohibida) y se cuenta cuántos errores detecta y cuántos textos buenos bloquea sin razón. Una revisión es un texto revisado una vez; en las primeras mediciones cada texto se revisó tres veces para ver si el resultado se mantiene.
| Fecha | Modelo | Revisiones | Con defecto | Detectó | Dejó pasar | Bloqueó sin motivo |
|---|---|---|---|---|---|---|
| 2026-09-04 | deepseek-v4-pro-0813 | 30 | 12 | 12 | 0 | 1 |
| 2026-09-04 | deepseek-v4-flash-0731 | 30 | 12 | 12 | 0 | 0 |
| 2026-09-11 | deepseek-v4-pro-0813 | 15 | 7 | 6 | 1 | 0 |
Lo que se le escapó
- 2026-09-11, deepseek-v4-pro-0813: dejó pasar un texto más largo que el límite del canal.
Cuando el error se escapa, la persona que firma todavía lo puede ver: el revisor es una capa, no la última. Pero una capa que a veces deja pasar un error no es una garantía, y por eso esas filas están aquí.
La elección del procedimiento: ¿entiende qué se le pide?
Cada tipo de encargo tiene su propio procedimiento escrito. Se le dieron al sistema encargos escritos como los escribe una persona de una agencia, no con las palabras del procedimiento, y se contó cuántas veces eligió el correcto. Dos de esos encargos no corresponden a ningún procedimiento, y la respuesta correcta era no elegir ninguno.
| Fecha | Modelo | Encargos | Eligió el procedimiento correcto | Respuestas inválidas |
|---|---|---|---|---|
| 2026-09-04 | deepseek-v4-flash-0731 | 20 | 14 | 4 |
| 2026-09-04 | deepseek-v4-pro-0813 | 20 | 19 | 0 |
Una respuesta inválida es una respuesta vacía, cortada o ilegible. Cuentan como error. El modelo más liviano falló más veces por eso que por equivocarse de procedimiento, y es una de las razones de que no sea el que revisa.
El recorrido completo: ¿se sostienen las detenciones?
Esta medición no mira si el texto es bueno. Recorre un encargo entero con modelos reales y comprueba que una herramienta con firma no pueda terminar sin detenerse, que la prueba que ve la persona se pueda firmar y que un rechazo le llegue al agente.
| Fecha | Modelo | Escenarios | Se sostuvieron | Costo en modelos |
|---|---|---|---|---|
| 2026-09-08 | deepseek-v4-pro-0813 | 3 | 3 | US$0.03 |
| 2026-09-11 | deepseek-v4-pro-0813 | 5 | 5 | US$0.05 |
Lo que la agencia ha hecho para el propio estudio
Kanvel es un cliente de su propia agencia, con las mismas firmas y el mismo registro. Esto es lo único de esta página que no es una prueba armada: es trabajo de verdad, contado del registro. Solo se cuenta cuántos hubo; ningún encargo, texto ni motivo se muestra.
Desde 2026-09-15, contado del registro cuando cargaste esta página.
| Encargos | Firmados | Devueltos con un motivo | Lo que costó en inteligencia artificial |
|---|---|---|---|
| 2 | 2 | 0 | US$0.45 |
Lo que esto no mide
- No mide resultados de clientes. Ningún canal real ha publicado y medido todavía. Por eso no hay aquí cifras de alcance, de ventas ni de clientes.
- Los casos los escribimos nosotros. Los errores puestos a propósito los pensó quien construyó el revisor. Una medición así dice si el revisor encuentra los errores que alguien imaginó, no los que alguien aún no imagina.
- Son pocos. Con tan pocos casos con error, uno solo que se escape pesa mucho en el porcentaje. Una medición con más casos mostraría un número más estable; repetir cada caso, como en las primeras mediciones, mide si el resultado se mantiene, no si cubre más tipos de error.
- Los casos se corrigieron al medirlos. En la primera medición dos textos que creíamos buenos tenían un error real: el revisor tenía razón y el caso estaba mal escrito. Se corrigieron los casos, y las filas de arriba son las de después.
- Que un modelo pase no significa que la próxima respuesta sea buena. Un modelo responde distinto cada vez. Esto mide la tendencia, y la firma de una persona sigue siendo lo que decide.
Cómo funciona cada capa está en Cómo trabajamos, y qué modelos se usan y con qué datos en Cómo usamos la IA.