Saltar al contenido
Volver a todas las notas nota de campo · 5 min

La semana en la fábrica de software: 13–20 de julio de 2026

Un millón de líneas de Rust portadas por agentes abrieron la discusión sobre la review, y todos los harness grandes añadieron superficies de control.

nota de campo 5 min

Las peleas interesantes de esta semana no fueron sobre si los agentes saben escribir código. Fueron sobre quién lo revisa, qué demuestra de verdad una suite en verde y cuánta parte del trabajo del operador quieren absorber los vendors de harness. Buena semana para quien colecciona evidencia de que el cuello de botella se movió de sitio.

Qué pasó

La reescritura de Bun se convirtió en el caso de estudio del debate de la verificación. El 8 de julio, Jarred Sumner, creador de Bun, publicó un informe contando cómo portó el runtime, unas 535.000 líneas de Zig, a Rust en once días con una flota de agentes Claude en paralelo, con un coste declarado de unos 165.000 dólares a precio de API. Según ese informe, el resultado pasa la suite de tests de Bun, más de un millón de aserciones. Esta semana llegó la respuesta. Andrew Kelley, creador de Zig, publicó su propio post defendiendo que el port salió sin review humana significativa y que los problemas de Bun eran de práctica de ingeniería, no del lenguaje, y uno de los hilos más grandes de la semana en Hacker News se echó encima de ambos bandos. Si quitas el ruido tribal, el desacuerdo es preciso. La afirmación de Sumner descansa por completo en la suite como contrato; la objeción de Kelley es que nadie sabe decir qué es lo que la suite no cubre. Los dos pueden tener razón a la vez. Esa es exactamente la distancia entre un build en verde y una feature correcta, demostrada ahora a una escala que ya nadie puede ignorar.

Claude Code publicó casi a diario, y de paso hizo manual la verificación. Entre el 11 y el 19 de julio, Anthropic encadenó releases de Claude Code (de la v2.1.207 a la v2.1.215). El harness sigue absorbiendo trabajo de scheduler que antes era tuyo. Las conversaciones bifurcadas ahora se convierten en sesiones en segundo plano, las llamadas MCP que pasan de dos minutos se mandan solas al fondo, y hay topes por sesión para búsquedas web y subagentes, que es la pinta que tiene domar una flota de sesiones paralelas cuando el vendor lo productiza. El detalle que yo no pasaría por alto está en la v2.1.215: las skills integradas de verificación y code review ya no se ejecutan solas. Ahora las invocas tú, explícitamente. La herramienta que escribe el código no lo comprueba si no se lo pides. Sea cual sea el motivo del cambio, el efecto es claro y apunta a algo que este sitio repite: el bucle de verificación pertenece al operador, no al piloto automático.

Codex endureció sus barandillas a nivel de CLI. Las releases de la CLI de Codex de esta semana (0.144.5 el 16 de julio, 0.144.6 el 18) ampliaron la detección de comandos peligrosos, añadieron explicaciones más claras cuando un comando se rechaza y corrigieron los metadatos de modelo para que las variantes de GPT-5.6 declaren su ventana real de 272.000 tokens. Nada de esto luce y todo esto sostiene peso. Unos metadatos de ventana equivocados rompen en silencio las ejecuciones largas, y un motivo de rechazo legible es la diferencia entre un operador que ajusta y uno que reintenta a ciegas. El changelog de Cursor del 17 de julio fue en dirección paralela: su agente de Slack ahora comparte el plan antes de ponerse a trabajar.

Visual Studio empezó a tomar huellas a los servidores MCP. La actualización del changelog de GitHub del 14 de julio para Visual Studio incluye validación de confianza para servidores MCP: el IDE compara la configuración y la huella de los assets del servidor contra una línea base aprobada al arrancar, y te pide re-aprobar si algo cambió. Un servidor MCP es una dependencia ejecutable con acceso a herramientas, y el tooling mayoritario empieza a tratarlo como la superficie de supply chain que es. Si tus agentes cargan herramientas que no has auditado, este es el recordatorio de que la brecha de confianza no se limita al código generado.

Cómo leerlo

Hay un hilo que atraviesa todo. El episodio de Bun demostró que la generación a escala absurda ya es una commodity que se compra, y la discusión que siguió fue enteramente sobre evidencia, review y qué cubre el contrato. Mientras tanto, los vendors de harness publicaron topes, backgrounding, huellas y motivos de rechazo, que son controles de operador, no mejoras de modelo. Las herramientas están concediendo, feature a feature, que lo difícil es operar la fábrica, no producir el código. Si construyes con agentes, la decisión que cambia esta semana es dónde gastas la atención de review. Un millón de aserciones en verde no cerró la discusión de Bun, y tu suite tampoco cerrará la tuya. La cierran los contratos y los momentos de review elegidos a propósito.

Qué es ruido: la charla del modelo de la semana y los ajustes promocionales de límites de uso. Nada de eso cambia una decisión.

Qué vigilar

La próxima especificación de MCP lleva fecha del 28 de julio y su release candidate es público desde mayo. Es la mayor revisión desde que existe el protocolo: núcleo stateless sin handshake de inicialización, cabeceras enrutables, las tareas largas como extensión formal y autorización endurecida alineada con OAuth. Ya hay SDKs beta para Python, TypeScript, Go y C#. El día uno no rompe nada, pero si operas servidores MCP remotos, el camino de migración ya merece una hora de tu semana.