🏴‍☠️ Viernes de Cagar y Aprender — Semana 29, 2026
El lunes le pedí a Claude Code que le agregara pruebas nuevas a mi benchmark de modelos de IA. Tenía un problema concreto: no lograba separar a Luna, Sol y Terra. Tres modelos de la misma familia, con precios que se van hasta 15 veces entre uno y otro, y en mis pruebas daban casi lo mismo. Si el barato y el caro rinden igual en tu tabla, tu tabla no le sirve a nadie para decidir.
Así que pedí pruebas más difíciles. Que le hagan un roast a un plan de negocio. Que expliquen cómo llegar a la rentabilidad. Lo que uno necesita saber antes de elegir con qué trabaja.
Me rompió el ranking. Tengo más de 140 modelos medidos ahí, con plata real todos los meses, y meses de cabeza encima. Me lo dejó en 6, con GPT-4.1 de falso número uno. Y de paso reventó el presupuesto: mandó todo demasiado rápido, muchas respuestas volvieron vacías, y las vacías se guardaron igual con puntaje cero. Tuve que meter créditos para pagar el desastre.
Nunca esperé que algo que venía funcionando se rompiera así, de un día para otro.
Llevo desde el lunes reparando. Pero esa no es la cagada.
Reparando encontré que las pruebas de agentes estaban revueltas con las de calidad general desde abril. 2.881 mediciones contaminadas. Otras 3.000 con fórmulas viejas mezcladas con nuevas. Respuestas vacías guardadas como buenas hace meses.
No se rompió mágicamente. Ya estaba roto. Lo del lunes solo me lo mostró.
Mi primera reacción fue echarle la culpa al modelo. Y no me equivoco: el benchmark lo escribe Claude Code, y los bugs los escribió Claude Code. Todos.
El que no los revisó en tres meses fui yo.
Puedo delegar el trabajo. No puedo delegar que el número sea verdad. Esa parte es del humano y no se terceriza.
¿Y si lo usaste estos meses? Me lo pregunté toda la semana. La respuesta honesta es que todavía no lo sé: estoy recalibrando de cero para saber qué se movió y qué no. Cuando tenga el número lo publico, salga como salga. Decirles hoy "quédense tranquilos que estaba bien" sería justo el error que acabo de cometer: afirmar sin medir.
Lo estoy relanzando con una forma nueva de medir y pruebas hechas para el trabajo real de un emprendedor en español, no para lucirse en una tabla. Y ahora ninguna cifra sale publicada sin pasar por una auditoría automática. Entre este fin de semana y la próxima lo suelto.
Ahora ustedes. ¿Cuál fue su cagada de la semana? Cuéntenla aquí abajo. Y si la venían arrastrando sin saberlo, cuenten también cómo se enteraron.
6
28 comments
Cristian Tala
6
🏴‍☠️ Viernes de Cagar y Aprender — Semana 29, 2026
Cágala, Aprende, Repite | CAR
skool.com/cagala-aprende-repite
Emprende con IA y haz rentable tu PYME o Startup — aprendiendo de tropiezos reales, no de gurús vendehumo. Cágala, Aprende, Repite.
Leaderboard (30-day)
Powered by