Saltar al contenido
● EN CURSO Crónica de 90 días 27 jul → 25 oct 2026 Con registro previo

Calibración · página viva

34 ofertas clasificadas a ciegas · 18 desacuerdos · 1 fallos de la máquina · 3 sin veredicto

¿Acierta la máquina que clasifica por mí?

Le doy al clasificador las ofertas que yo ya había clasificado a mano, sin enseñarle mis respuestas, y publico en cuántas coincide y en cuáles no.

Un modelo de lenguaje clasifica las ofertas del listado público aplicando mis criterios publicados. Eso plantea un problema evidente: si nadie comprueba al que mide, el resultado deja de ser «cuántas ofertas dejan entrar a alguien de España» y pasa a ser «cuántas cree un modelo que dejan entrar».

Prometer que lo reviso todo no resuelve nada, porque no se puede comprobar desde fuera y porque una revisión que no puedo sostener acabaría siendo un sello de goma. Así que en vez de prometer, mido.

Las ofertas que la plataforma me manda por correo son las únicas que clasifiqué a mano, una a una, antes de que existiera el clasificador. Son un patrón etiquetado gratis. Se las doy al modelo sin enseñarle mis respuestas, comparo, y lo que sale es esto.

Conviene decir lo que este número no demuestra. Son pocas ofertas. Son las de correo, que llegan con el asunto «matches your skills» y por tanto son las fáciles: el listado público es más variado y más raro, así que esta tasa es una cota optimista.

Lo que sí se puede leer es la forma de los desacuerdos, que está abajo entera, uno por uno y con el veredicto al lado. Cuando el que se equivocó fui yo, lo digo y corrijo la fila. Cuando todavía no lo he mirado, pone «pendiente»: prefiero publicar un hueco a publicar un veredicto que no he dado.

Dos correcciones, del 15 de agosto de 2026

Esta página midió durante cinco días un clasificador que no estaba funcionando. El prompt que se le da al modelo está escrito en dos sitios: el clasificador de verdad y esta prueba. El 10 de agosto cambié una regla en el primero y no en el segundo, así que del 10 al 15 el número publicado aquí correspondía a una versión que ya no clasificaba nada. Ya están sincronizados, y el arreglo de fondo —sacar el prompt a un fichero del repositorio para que los dos lo lean del mismo sitio— está pendiente.

Y he cambiado de modelo. No por corazonada: medí tres sobre este mismo patrón y con el mismo prompt.

acuerdotokens por ofertade ellos, razonar
kimi-k2.6 (el de antes)89,4 %72843534
kimi-k3 esfuerzo bajo89,8 %404327
kimi-k3 esfuerzo alto89,8 %4209182

El que uso ahora acierta igual o algo más, cuesta un 44 % menos y razona ciento treinta veces menos. Subir el esfuerzo no cambia ni una sola clasificación: lo que el modelo caro hacía con 3534 tokens de razonamiento —contar caracteres a mano, redactar tres títulos y descartar dos— no mejoraba la respuesta.

Digo esto aquí porque cambiar el modelo cambia lo que mide esta página, y un número sin decir de qué es no vale nada.

La pregunta única, del 16 de agosto de 2026

Hasta ayer le hacía al modelo dos preguntas sueltas: «¿me dejan entrar?» y «¿puedo hacerla?», cada una con su propio juicio. Desde hoy le hago una sola —«¿puedo optar a esta oferta, y si no, por qué?»— y de la respuesta salen los dos campos de siempre, calculados por código: si el obstáculo es de geografía o papeleo, cierra «¿me dejan entrar?»; si es de idioma, habilidad o aparato, cierra «¿puedo hacerla?». Sin obstáculo, las dos son «sí». Es lo mismo que ya decía Método que hacía la web, aplicado también al clasificador.

Esto tiene un efecto en el número de abajo que conviene explicar, porque si no parece que la máquina haya empeorado y no es así. compatible cae de 80,6 % a 52,9 %. La causa, en catorce de los dieciséis desacuerdos, es que antes yo marcaba a veces el mismo problema en las dos columnas a la vez —por ejemplo, «exige un número de teléfono de EE. UU.» como un «no» en las dos—, y ahora la pregunta única solo puede contarlo una vez. La respuesta que se publica, «¿puedo optar?», no cambia en ninguno de esos casos: seguía saliendo «no» por la otra columna.

Hay una excepción que sí es un límite real, no cosmético: dos ofertas pedían a la vez un obstáculo de geografía y uno de idioma, dos problemas independientes. La pregunta única solo puede reportar uno, así que el segundo desaparece del todo del campo que le tocaba. La respuesta final sigue siendo correcta —la primera barrera ya basta para decir que no—, pero si algún día esa primera barrera dejara de aplicar, la ficha diría que sí puedo cuando en realidad tampoco, por el idioma. Es un límite del diseño que decidí aceptar en vez de complicar la pregunta otra vez, y queda anotado en cada una de las dos filas que lo tienen.

El resto —un desacuerdo de disponible_es y uno de modalidad, además de tres que siguen sin veredicto— son casos normales de la clasificación, no del cambio de pregunta.

¿Me dejan entrar? · H5
33/34
¿Puedo hacerla? · H4
18/34
¿Dónde hay que estar? · H4
31/32

disponible_es 97.1 % · compatible 52.9 % · modalidad 96.9 %

disponible_es — Es el único campo que el clasificador aporta a una hipótesis: la 5 se calcula sobre las ofertas del listado público.
compatible — El número baja de golpe al pasar a la pregunta única, pero no porque la máquina acierte menos: la mayoría de los 16 desacuerdos son dobles marcas mías de antes que ya no se pueden repetir en dos campos. Detalle en nota_pregunta_unica y en la tabla de abajo.
modalidad — 32 de las 34 comparan: dos ofertas no las clasifiqué yo a mano. De las 32, una es un fallo real de la máquina, no de la pregunta única.

Los 18 desacuerdos, uno por uno

5 veces la máquina fue más restrictiva que yo —dijo «no» donde yo había dicho «sí»— y 12 veces al revés. La mayoría de las segundas no son la máquina cediendo terreno: son una doble marca mía de antes de la pregunta única, que ahora solo se puede contar una vez. Detalle abajo.

OfertaCampoYoLa máquinaQuién se equivocó
Urgent: call Stephanie tonight to coordinate dinnercompatiblesino · la llamada se presume en inglés y no lo hablo con solturaNinguno: cambié el criterio
La oferta es una llamada de teléfono a un número de Estados Unidos y no dice en qué idioma. La regla del idioma presunto, que aprobé el mismo día de la primera prueba, dice que se presume inglés. Yo la había clasificado antes de que esa regla existiera.
QA test: GitHub QA: #2824 @ 58ba5edfdae2 — 2026-08-04compatiblesino · exige narración de voz en vídeo, que se presume en inglés, y no lo hablo con solturaNinguno: cambié el criterio
La oferta pide grabar la pantalla y el micrófono y «narrate your actions», sin decir en qué idioma. Se presume inglés, y no lo hablo con soltura. Yo la había clasificado antes de que existiera esa regla.
QA test: Taste iPhone TestFlight QA — build 7 — 2026-08-06compatiblesino · la narración en voz de la grabación se presume en inglés y no lo hablo con solturaNinguno: cambié el criterio
La oferta pide grabar la pantalla y el micrófono y «narrate your actions», sin decir en qué idioma. Se presume inglés, y no lo hablo con soltura. Yo la había clasificado antes de que existiera esa regla.
QA test: Amboras first-impression review — 2026-08-06compatiblesino · exige narrar la prueba en voz y se presume en inglés, que no hablo con solturaNinguno: cambié el criterio
La oferta pide grabar la pantalla y el micrófono y «narrate your actions», sin decir en qué idioma. Se presume inglés, y no lo hablo con soltura. Yo la había clasificado antes de que existiera esa regla.
Receive and Reply to One SMS Using a US Phone Numbercompatiblenosi · exige un número de teléfono de EE. UU. real, no VoIPNinguno: cambié el criterio
Este obstáculo ya lo tenía marcado como disponible_es:no —no coincide en esa columna—, y antes lo marcaba también en compatible, doble. Desde el 16 de agosto la barrera única lo cuenta una sola vez, en disponible_es, que es donde ya estaba en mis propios criterios. El «¿puedo optar?» publicado sigue en «no».
Send a Test Text Message to Confirm Phone Number is Activecompatiblenosi · exige estar ubicado en Estados UnidosNinguno: cambié el criterio
Mismo patrón que el anterior: doble marca mía de antes, ahora contada una sola vez en disponible_es, que también sale «no». El «¿puedo optar?» publicado no cambia.
[TEST – DO NOT APPLY] Evidence portal canary 47e772d7compatiblenosi · está reservada a una cuenta concreta de la plataformaNinguno: cambié el criterio
Mismo patrón: doble marca de antes, ahora solo en disponible_es. El «¿puedo optar?» sigue en «no».
Paid App Usage & Data Contribution Study — US, $75–$145compatiblenosi · exige estar ubicado en Estados UnidosNinguno: cambié el criterio
Mismo patrón: doble marca de antes, ahora solo en disponible_es. El «¿puedo optar?» sigue en «no».
Referral Bounty: Founding Program Director for Gravity Wizards Inc. (STEM Youth Leader)compatiblenosi · exige residencia legal en Estados UnidosNinguno: cambié el criterio
Mismo patrón: doble marca de antes, ahora solo en disponible_es. El «¿puedo optar?» sigue en «no».
Technical & Business Meeting Representative for Website Build Projectcompatiblenosi · exige residir en Estados Unidos o Reino UnidoNinguno: cambié el criterio
Este es uno de los dos casos reales, no cosmético: la oferta exige a la vez residir en EE. UU./Reino Unido Y inglés nativo con videollamadas profesionales. La barrera única solo reportó la de geografía; la de idioma, que yo también tenía anotada, desaparece del campo compatible. El «¿puedo optar?» publicado no cambia —sigue en «no» por disponible_es—, pero si algún día la barrera de geografía dejara de aplicar, esta ficha diría «compatible: sí» sin que sea del todo cierto. Límite conocido y aceptado del diseño de una sola barrera.
T-Mobile Android Spam Test — 10 min active work, $15compatiblenosi · exige estar en Estados Unidos y tener línea móvil de T-MobileNinguno: cambié el criterio
Mismo patrón de doble marca: ahora solo en disponible_es, que sale «no». El «¿puedo optar?» no cambia.
Urgent Phone Researcher — Verify 4 North Beach Apartment Prospectsdisponible_essino · exige ser un investigador ubicado en Estados UnidosSin mirar todavía
Sigue sin resolver desde la prueba anterior. Hay que releer el anuncio: el encargo se declara remoto, pero pide llamar a San Francisco en horario comercial.
Urgent Phone Researcher — Verify 4 North Beach Apartment Prospectscompatiblenosi · exige ser un investigador ubicado en Estados UnidosSin mirar todavía
Mismo encargo que el desacuerdo anterior, mismo obstáculo sin resolver. Hasta que decida si la barrera de geografía aplica, esta fila tampoco tiene veredicto firme.
QA test: Rent A Human evidence upload QA — 2026-08-12compatiblenosiSin mirar todavía
Aquí la máquina no dio ningún motivo y en cambio preguntó si tenía asignada una conversación de QA en la plataforma: no vio el requisito de narración en inglés que yo anoté en su día. No es el patrón de doble marca de los demás desacuerdos de esta prueba: hay que releer el anuncio para saber si el requisito sigue ahí o si me lo inventé yo.
Record a first-listen reaction to a personalized songcompatiblenosi · exige residir en Estados UnidosNinguno: cambié el criterio
El segundo de los dos casos reales: la oferta exige a la vez residir en Estados Unidos Y comunicarse en inglés, y yo tenía anotadas las dos cosas. La barrera única solo reportó la de geografía. El «¿puedo optar?» publicado sigue en «no» por disponible_es, pero el campo compatible en solitario ya no refleja el obstáculo de idioma. Mismo límite conocido que el caso anterior.
T-Mobile or Verizon Android Spam Test — 10 min active work, $15compatiblenosi · exige línea directa con T-Mobile o Verizon y estar en el territorio continental de EE. UU.Ninguno: cambié el criterio
El desacuerdo de disponible_es que tenía pendiente esta oferta en la prueba anterior ya no existe: mi propia ficha y la máquina coinciden ahora en «no». Lo que queda es la doble marca de siempre: el obstáculo ya cuenta en disponible_es y desaparece de compatible.
T-Mobile or Verizon Android Spam Test — ~15 min active work, $25compatiblenosi · exige línea con T-Mobile o Verizon y estar en el territorio continental de EE. UU.Ninguno: cambié el criterio
Mismo patrón de doble marca que la oferta anterior, casi idéntica.
T-Mobile or Verizon Android Spam Test — ~15 min active work, $25modalidadpresencial fuera de Galiciaremota · exige línea con T-Mobile o Verizon y estar en el territorio continental de EE. UU.La máquina
Este sí es un fallo de la máquina, y no tiene que ver con la pregunta única: exigir una línea de un operador de Estados Unidos y estar en su territorio continental es presencia física, no trabajo remoto, aunque la oferta diga «remote work allowed». La máquina se quedó con la etiqueta y no razonó la condición.

14 desacuerdos vienen de un criterio que cambió después de clasificar esas ofertas a mano: unos, porque la regla del idioma presunto —hablar sin decir en qué idioma se presume el de la oferta, casi siempre inglés— es posterior a mi clasificación; otros, porque antes marcaba el mismo obstáculo en dos columnas a la vez y la pregunta única ya solo lo cuenta en una. 1 es un error de la máquina. Y 3 se quedan sin veredicto: todavía no he releído los anuncios. Prefiero publicar el hueco a publicar un veredicto que no he dado.

El 16 de agosto de 2026 el clasificador pasó a pedir una sola barrera en vez de dos juicios sueltos. La mayoría de los desacuerdos de compatible son la limpieza de un doble marcado que yo hacía antes; dos son un límite real y aceptado del diseño. Detalle en /calibracion/.

Prueba del 2026-08-16, modelo kimi-k3 (reasoning_effort: low), criterios versión 3. Patrón: las ofertas que la plataforma me mandó por correo, 34 comparadas. El patrón crece solo, según entran alertas: eran 23 el 9 de agosto y son 34 el 16. Las que llegaron muertas (error 404) no tienen texto que clasificar y quedan fuera. El modelo respondió a las 34. Los datos están en data/calibracion.yaml; los criterios que aplica la máquina, en data/criterios.yaml. Cómo funciona todo esto está en Método.