Créditos

Aquí no se corre ningún benchmark. Todo el mérito de los números es de quien los midió; lo único que ponemos nosotros es el cruce. Si algo está mal, lo más probable es que el error sea nuestro al combinarlos.

Fuentes en uso

Catálogo y precios: models.dev

MIT

catalogo
Disponibilidad y precios cruzados: OpenRouter

API pública sin autenticación.

catalogo
Ranking de uso en programación: OpenRouter

API pública sin autenticación.

catalogo
DeepSWE v1.1, de Datacurve

Leaderboard público. robots.txt permite crawling general; bloquea solo crawlers de entrenamiento.

Un fetch al día, User-Agent identificable, atribución con enlace en cada tarjeta.

benchmark
CursorBench 4.0, de Cursor

Leaderboard público; robots.txt permite /cursorbench explícitamente.

benchmark
Terminal-Bench 2.0, de Stanford / Harbor / Laude Institute

Leaderboard público; el sitio no publica robots.txt y marca noindex.

Un fetch al día, User-Agent identificable. Cada fila es agente+modelo: nos quedamos con el mejor por modelo.

benchmark

Reconocidas pero no usadas

Hay trabajo que respetamos y que aun así no aparece en los números. Cuando el motivo es la licencia, lo decimos en vez de estirar la interpretación.

API gratuita: solo uso interno, sin redistribución. Publicar sus scores requiere licencia comercial.

No encender sin permiso escrito de Artificial Analysis. Requiere ARTIFICIAL_ANALYSIS_API_KEY.

Cómo leemos

Una descarga al día por fuente, con un User-Agent que dice quiénes somos. No entrenamos nada con estos datos ni los revendemos: se muestran con enlace a su origen para que cualquiera pueda ir a comprobarlos. Si mantienes alguna de estas fuentes y prefieres que no la leamos así, escríbenos y la quitamos.