Cómo se calcula
Ninguna de las tres respuestas está elegida a mano. Salen de cruzar 3 benchmarks con el costo real por tarea y aplicar tres reglas. Si alguna sorprende, lo que hay que discutir es qué benchmarks entran.
La unidad es el modelo por nivel de effort
No recomendamos un modelo, recomendamos un modelo a un nivel de effort. Ahora mismo el caso más caro de ignorarlo es este: en DeepSWE v1.1, Claude Fable 5 en low saca 59.6% a $2.76 por tarea y en max saca 69.7% a $20.62. Son 10.1 puntos por 7.5 veces el precio. Tratar las dos configuraciones como el mismo modelo esconde justo la decisión que más dinero mueve.
Calidad
Cada benchmark se normaliza contra el mejor y el peor resultado del conjunto completo, no del subconjunto que dejen tus filtros, para que un mismo modelo no cambie de número al mover un control. Después se promedia.
Todos los que entran pesan lo mismo. Nadie sabe si CursorBench vale exactamente 1.2 veces lo que vale DeepSWE, y un número con dos decimales parece medido aunque esté inventado. Lo único que se decide es cuáles entran.
Solo cuentan los benchmarks que existen para ese modelo, y los pesos se renormalizan. Para poder ganar una tarjeta hacen falta al menos 2 benchmarks distintos: sin esa regla, un modelo medido por uno solo, el que mejor le venga, sale con calidad 100 y se cuela por delante de otro medido por tres. Los que no llegan siguen visibles en su ficha.
La banda, no el punto
Los benchmarks que publican intervalos de confianza los publican anchos. La banda más ancha que hay hoy es la de GPT-5.5 en xhigh: calidad 90.2 con un intervalo que va de 81.3 a 99.2. Ordenar por el número central y presumir de décimas sería fingir una precisión que la medición no tiene.
Por eso cuando dos intervalos se solapan, el desempate es el costo. Es lo que hace que la tarjeta de “necesito uno bueno” a veces recomiende algo más barato que el primero de la tabla: son indistinguibles, y uno cuesta menos.
Costo
Cuando un benchmark mide cuánto costó de verdad resolver sus tareas, usamos ese número, y cuando hay más de uno mostramos el rango.
No todo “$ por tarea” es comparable: hace falta que el andamio sea el mismo y que las tareas se parezcan. Un costo reportado por cada equipo con su propio montaje sobre tareas más fáciles hace aparecer modelos “de siete centavos” que no lo son, así que no entra en el eje de costo aunque lo guardemos.
Para lo que nadie ha costeado, estimamos a partir del precio de lista con una mezcla de tokens agéntica: 70% lecturas de caché, 20% entrada fresca y 10% salida. No es una suposición: sale del desglose de tokens que publica DeepSWE por corrida. El clásico 3:1 entrada:salida se equivoca casi por un orden de magnitud en este tipo de carga. Todo lo estimado va marcado como tal.
Las tres reglas
Primero se descarta lo dominado: si otro modelo es mejor y más barato, ninguna respuesta puede ser este. Lo que queda es la frontier, donde cada paso es un intercambio real.
- Barato: el de mayor calidad dentro del 33% más económico, siempre que conserve al menos el 60% de la calidad del líder. El piso existe porque un modelo que se equivoca sale más caro en revisiones de lo que ahorra en tokens.
- Día a día: el codo de la frontier. Se traza la cuerda entre el extremo barato y el mejor, con el costo en escala logarítmica porque la diferencia entre $1 y $2 se siente como la de $8 a $16, y gana el punto que más se despega hacia arriba de esa recta, sin bajar del 75% de la calidad del líder.
- Necesito uno bueno: el de más calidad; entre los que empatan dentro del margen de error, el más barato.
Las tres tienen que ser tres modelos distintos y en orden de precio. Cuando no hay datos para las tres, salen dos: repetir el mismo modelo en dos tarjetas sería fingir una elección que no existe.
Perfiles
Cambiar el tipo de tarea no reordena pesos: cambia qué benchmarks cuentan, y vuelve a correr las tres reglas enteras sobre los mismos datos. Así la pregunta que hay que discutir es una que se puede contestar, como si Terminal-Bench mide el trabajo de arreglar bugs, y no cuánto vale 0.35 frente a 0.30.
Lo que esto no es
No es una medición propia: no corremos ningún benchmark, cruzamos los de otros. Si una fuente se equivoca, nosotros nos equivocamos con ella. Y un modelo recién salido tarda en aparecer, porque hasta que alguien lo mide no tenemos nada que decir de él.
6 de 7 fuentes activas · 81 variantes puntuadas