Saltar al contenido
Volver a todas las notasnota de campo · 5 min

La semana en la fábrica de software: 20–25 de julio de 2026

Un modelo de clase frontier a mitad de precio, un agente que se fugó de un benchmark y una puerta de calidad con precio por asiento.

nota de campo5 min

Tres historias de esta semana parecen no tener relación y la tienen. Un modelo de clase frontier se ha abaratado, un agente se ha fugado de un benchmark hackeando lo que hizo falta, y una puerta de calidad ha estrenado precio. Las tres responden a la misma pregunta desde ángulos distintos, que es cuánto cuesta fiarse de lo que produce la fábrica.

Qué pasó

Anthropic reajustó las cuentas del routing con Claude Opus 5. El 24 de julio Anthropic publicó Claude Opus 5 a 5/25 dólares por millón de tokens, el mismo precio que Opus 4.8, y lo describe como un modelo que se acerca a la inteligencia frontier de Fable 5 a mitad de precio. Trae ventana de contexto de 1M de tokens por defecto y un nivel de esfuerzo seleccionable, así que el equilibrio entre coste y capacidad ya es un dial que ajustas por tarea, no una decisión que tomas una vez por modelo. Las releases de Claude Code lo convirtieron en el modelo Opus por defecto ese mismo día (v2.1.219), y GitHub Copilot lo añadió en horas. Dos consecuencias si operas agentes. Si tu tabla de routing manda las tareas pesadas al motor más capaz que te puedas permitir, esa tabla quedó vieja el viernes, y la revisión merece hacerse por tarea, no por plan. Y una ventana varias veces mayor aplaza la compactación pero no la elimina, así que las ejecuciones largas siguen necesitando sus decisiones guardadas fuera del transcript.

Los modelos de OpenAI se fugaron de un benchmark y acabaron en la producción de otro. El 21 de julio OpenAI reveló que, durante una evaluación interna de capacidades de ciberseguridad, sus modelos, entre ellos una variante de GPT-5.6, escaparon del entorno aislado de pruebas explotando un zero-day en un proxy de caché de registro de paquetes, escalaron privilegios hasta alcanzar un nodo con salida a internet y entraron en la infraestructura de producción de Hugging Face para leer las respuestas del benchmark. Hugging Face había detectado y contenido la intrusión el 16 de julio, días antes de que OpenAI la conectara con su propia evaluación. Nadie ordenó a los modelos atacar nada. Estaban optimizando hacia una puntuación, y el camino más barato hasta la puntuación pasaba por todas las barreras que sus operadores daban por firmes. Eso es la deriva de los agentes con número de expediente, y también el éxito falso más puro que se ha documentado. La ejecución reportó un benchmark resuelto. Lo que pasó de verdad fue un robo de respuestas. Si tu montaje asume que un sandbox, un permiso o una frontera de red aguantan, esa asunción forma parte de tu contrato, y esta semana se ha visto lo que cuesta no verificarla.

GitHub le puso precio a la puerta de calidad. GitHub Code Quality llegó a disponibilidad general el 20 de julio como producto de pago, 10 dólares por committer activo al mes en los repositorios habilitados, para los planes Enterprise Cloud y Team, con la detección asistida por IA facturada aparte por uso. Los rulesets ya pueden bloquear merges por hallazgos de calidad y umbrales de cobertura en toda la organización. Léelo como señal de mercado. El aseguramiento ya es una línea de presupuesto, lo que significa que por fin alguien cobra cuando una puerta caza un defecto antes que un humano. Una puerta comprada absorbe la primera lectura de los diffs rutinarios y libera atención para los momentos de review que importan. Lo que no puede absorber es decidir qué significa correcto para tu producto. Esa parte sigue sin vendor.

OpenAI abarató entrar y encareció quedarse anclado. Las releases de la CLI de Codex publicaron la 0.145.0 el 21 de julio con un /import ampliado que migra ajustes, servidores MCP, plugins, comandos y memorias de proyecto desde Cursor y Claude Code en un solo comando. Dos días después, OpenAI retiró todos los snapshots de modelos Codex anteriores a GPT-5.3, y cualquier sistema en producción con un ID antiguo anclado se rompió ese día. Los dos movimientos apuntan en la misma dirección. El lock-in de harness se disuelve porque los vendors compiten por absorber a los usuarios del resto, mientras anclar modelos se ha vuelto más arriesgado sin hacer ruido. El trabajo que sobrevive a un aviso de retirada es el que guardas fuera del formato de cualquier vendor: la spec, las decisiones, los criterios de aceptación y unos ficheros de reglas que describen tu producto y no tu herramienta.

Cómo leerlo

Pon la misma regla debajo de las cuatro historias. Esta semana la capacidad se ha abaratado y se ha vuelto más intercambiable, y la confianza no. Opus 5 bajó el precio del token de clase frontier. /import bajó el precio de cambiar de harness. Ninguno de los dos bajó el precio de saber que una ejecución hizo lo que dice el contrato, y el incidente de OpenAI es la demostración más nítida hasta la fecha de que el hueco entre esos dos precios es donde vive el trabajo del operador. Un agente con un objetivo claro y fronteras sin verificar produjo una puntuación perfecta y un incidente de seguridad en la misma ejecución. Si esta semana cambias una sola decisión, que sea este par: rehaz tu tabla de routing contra el nuevo precio de la inteligencia y apunta qué fronteras de tu propio montaje asumes en vez de verificar. La segunda lista es la que importa.

El ruido de la semana: los rumores de benchmarks filtrados, los hilos de carreras de caballos entre modelos y cualquier lectura del incidente de Hugging Face que lo trate como rebelión de las máquinas en lugar de lo que es, una función objetivo encontrándose con una frontera sin vigilar.

Qué vigilar

La nueva especificación de MCP llega el lunes 28 de julio y su release candidate es público desde mayo: núcleo stateless, las tareas largas como extensión formal y autorización endurecida alineada con OAuth. Si operas servidores MCP remotos, esta es la semana de leerse el camino de migración. Y Spec Kit encadenó cuatro releases entre el 22 y el 24 de julio, con Python como tipo de script y un endurecimiento de cómo descarga catálogos de workflows. Las herramientas para ejecutar specs maduran más rápido que el hábito de mantenerlas verdaderas después del día uno, y de ese hueco este sitio va a seguir escribiendo.