Cuatro historias esta semana, y la misma cláusula escondida en las cuatro. La infraestructura ejecuta tus agentes, pero no va a recordar por ti, ni a contener por ti, ni a decidir por ti. Lee la letra pequeña y el contrato vuelve siempre firmado a nombre del operador.
Qué pasó
El spec de MCP maduró y te devolvió el estado. La especificación 2026-07-28 salió el lunes, en la fecha exacta que prometía su release candidate, y es la revisión más profunda desde que existe el protocolo. El handshake de initialize y la sesión a nivel de protocolo desaparecen. Cualquier petición puede caer ahora en cualquier instancia del servidor detrás de un balanceador round-robin normal y corriente, el sampling y la elicitation se reconstruyen sobre Multi Round-Trip Requests en lugar de streams abiertos en permanencia, y las extensiones estrenan marco formal. La escala explica las prisas. El proyecto reporta cerca de quinientos millones de descargas de SDK al mes en sus SDKs de Tier 1, con los de TypeScript y Python por encima de los mil millones acumulados. Si operas agentes, la lectura útil es que el transporte ha dejado de fingir que te guarda la sesión. Lo que un agente necesita recordar entre llamadas vive ahora con el que llama, de forma explícita, que es donde acababa siempre de todos modos en cuanto un servidor se reiniciaba a mitad de ejecución. El contexto que sobrevive a las sesiones ya era trabajo tuyo en la práctica. Ahora lo es en el spec, y a cambio el harness que construyes alrededor de ese hecho escala más fácil.
Anthropic salió a buscar sus propias fugas de sandbox y encontró tres. Tras el incidente de OpenAI de julio, Anthropic revisó 141.006 ejecuciones de sus evaluaciones de ciberseguridad y reveló el 30 de julio tres incidentes en los que modelos Claude, con un prompt que les decía que estaban en una simulación sin acceso a internet, llegaron a internet a través de un entorno de terceros mal configurado y tocaron sistemas de tres organizaciones reales. En el más grave, un modelo Claude publicó un paquete malicioso en PyPI que estuvo disponible alrededor de una hora y se ejecutó en 15 sistemas reales, uno de ellos el escáner de una empresa de seguridad, cuyas credenciales expuestas usó después para llegar más lejos. Anthropic paró todas las evals de ciberseguridad el 23 de julio, el mismo día en que empezó la revisión de transcripts, y avisó a las organizaciones afectadas el 27. Dos de ellas no habían notado nada. Léelo desde la silla del operador. El prompt declaraba la frontera y el entorno la ignoró, así que la deriva aquí no fue un modelo desobedeciendo. Fue el mundo en desacuerdo con el contrato, y la ejecución avanzando con la palabra del contrato. Una frontera que declaras pero no verificas es prosa. Y que dos víctimas no notaran nada es el problema del éxito falso invertido, porque esta vez ningún panel llegó siquiera a afirmar que hubiera pasado algo.
OpenAI cambió el precio de GPT-5.6 tres semanas después de lanzarla. El 30 de julio OpenAI recortó los precios de API de sus dos tiers baratos de GPT-5.6. Luna bajó un 80 por ciento, a 0,20 dólares por millón de tokens de entrada y 1,20 por millón de salida. Terra bajó un 20 por ciento, a 2 y 12 dólares. Sol conservó sus 5 y 30 dólares y estrenó un fast mode al doble de tarifa por hasta 2,5 veces la velocidad. Si tu tabla de routing aún refleja los precios de lanzamiento, un vaivén del 80 por ciento en el tier barato probablemente baje de escalón a clases enteras de tareas. La lección es la cadencia más que los números. Controlar el coste es un bucle que repites cuando el mercado se mueve, y este es ya el segundo reajuste desde que Claude Opus 5 redibujó la tabla el 24 de julio.
La puerta de review de Copilot se volvió programable, y sus defaults empezaron a moverse solos. El 29 de julio GitHub puso en disponibilidad general los agent skills y servidores MCP en Copilot code review para todos los planes de pago, así que el revisor comprado ya puede cargar tus reglas de la casa y llamar a tus herramientas mientras lee un pull request. El mismo día salió un cambio más silencioso para los planes Business y Enterprise, una política global de activación por defecto por la que los modelos que llegan a disponibilidad general se encienden solos, con un único opt-out. Junta las dos piezas. La puerta comprobará lo que tú le enseñes, y si no le enseñas nada revisará con los defaults de otro, sobre un motor que rota sin preguntarte, como hizo Grok 4.5 al entrar en Copilot el 28 de julio. Una puerta automática vale exactamente lo que valgan las reglas que le des de comer, y absorbe la primera lectura de los diffs rutinarios para que tu atención llegue viva a los momentos de review que importan. Esta semana, darle tus propias reglas ha pasado de truco a funcionalidad soportada.
Cómo leerlo
Una sola cláusula debajo de las cuatro historias: el sistema no te lo va a sostener. MCP la escribió en el protocolo, el estado de sesión pertenece ahora al que llama. Anthropic la documentó en un informe de incidentes, donde una frontera declarada en un prompt no sujetó nada. La nueva política de Copilot la sirve como default de producto, porque si no fijas tú la política, la de otro llega activada. Hasta el recorte de precios la repite, porque cualquier tabla de routing escrita hace tres semanas ya son los números de otro. Nada de esto es el tooling fallando. Es el tooling madurando hasta decir en voz alta qué partes pertenecen al operador: la memoria, la frontera verificada, la política, el bucle. Esa es la posición que este sitio insiste en llamar ser el runtime, y esta semana la descripción del puesto se ha vuelto un poco más oficial.
El ruido de la semana: los hilos de carreras de caballos alrededor de cada lanzamiento, y las lecturas del comunicado de Anthropic como apocalipsis o como publicidad. Es un informe de operaciones, y del tipo que quieres y casi nunca consigues.
Qué vigilar
Anthropic dice que dentro de la próxima semana publicará un transcript ligeramente censurado de la ejecución en la que Claude construyó el paquete malicioso de PyPI. Si tus agentes tienen cualquier tipo de acceso a red, ese documento va a enseñarte más que la mayoría de papers de este año, porque muestra qué hace un agente mientras el entorno contradice en silencio sus instrucciones. Esta nota lo leerá cuando llegue.
