Saltar al contenido
Volver a todas las notasnota de campo · 6 min

La semana en la fábrica de software: 3–10 de octubre de 2026

Claude Haiku 5.5 se ha convertido en el modelo pequeño por defecto en Claude Code y GitHub Copilot el mismo día que ha salido. Lo interesante es lo que otras tres novedades de esta semana han decidido que un modelo nunca debe comprobar por su cuenta.

nota de campo6 min

Cuatro novedades de esta semana trazan la misma línea en sitios distintos: qué puede decidir un modelo y qué tiene que decidir una regla a la que no le importa lo seguro que suene. Un modelo pequeño nuevo se queda con el trabajo repetitivo que otros modelos malgastaban capacidad en hacer. Un asistente de código cierra la ejecución de herramientas detrás de una frontera del sistema operativo en vez de dejarlo al criterio. Un programa de seguridad mide niveles de confianza en vez de prometerlos. Y un paper defiende que una spec, para que se pueda confiar en ella, necesita una parte que no llame nunca a un modelo.

Qué ha pasado

Claude Haiku 5.5 ha salido y se ha convertido en el modelo pequeño por defecto en todas partes el mismo día. Anthropic ha presentado Claude Haiku 5.5 el 7 de octubre, llamándolo «the cheapest, fastest, and most capable small model we’ve ever released», con un precio un 90% más bajo que Haiku 4.5 para prompts de hasta 100.000 tokens (0,10$/0,50$ por millón de tokens de entrada/salida, frente a 1$/5$) y «around 75% less» de coste en promedio. El salto en benchmarks agénticos es grande: 72,4% en el subconjunto offline de OSWorld 2.1 frente al 15,7% de Haiku 4.5, y 39,2% en Terminal-Bench 4.0 frente al 0,0%. El mismo día, las notas de la versión v2.1.293 de Claude Code lo convirtieron en el Haiku por defecto de la API de Anthropic con 1 millón de tokens de contexto, y GitHub Copilot lo añadió ese mismo día. El planteamiento de Anthropic importa: Haiku 5.5 es para «quick and repetitive workloads» como resúmenes o clasificación, emparejado con Sonnet 5.5 u Opus 5.5 «as a subagent», no como sustituto donde haga falta criterio. La orquestación multiagente se abarata justo en la capa que nunca estuvo pensada para razonar.

GitHub Copilot ha lanzado dos mecanismos de gobierno, uno que se aprueba y otro que no se puede saltar. El sandboxing local ha llegado a disponibilidad general el 7 de octubre en Copilot CLI, la app de Copilot y el Agent Host de VS Code, en Windows, macOS y Linux, sobre el eXecution Container de Microsoft, que traduce una sola política de sandbox a controles nativos del sistema operativo. Restringe lo que pueden tocar los comandos de las herramientas, sistema de archivos, red, credenciales de Git, «regardless of which model Copilot uses», y las organizaciones pueden fijar una política que ningún desarrollador puede debilitar. El uso del ordenador ha entrado en vista previa pública el 1 de octubre para apps sin API ni CLI: Copilot hace clic, escribe y lee pantallas en tu nombre, pero «asks for approval before controlling an app», y las organizaciones pueden apagarlo del todo. Un mecanismo es un muro que no pregunta por cada acción. El otro es una puerta que sigue llamando. Los handoffs entre agentes de una herramienta a otra acaban de recibir dos respuestas distintas a quién puede decir que no.

Anthropic ha convertido «nos tomamos la seguridad en serio» en una cifra que se puede comprobar. El 8 de octubre, Anthropic ha lanzado la Cyber Mission: un escáner de vulnerabilidades de código abierto y gratuito que dice encontrar verdaderos positivos «above 90%» de las veces, más un Programa de Defensa de Infraestructura Crítica con 11 socios fundadores, entre ellos CrowdStrike, Deloitte y Palo Alto Networks. Dos días antes, el Programa de Verificación Cibernética ampliado ha sustituido una promesa genérica por acceso medido y por niveles: en Defense Access, «46 of the 50 trials were blocked at some point in the challenge». En Red Team Access, con verificación completa, «no blocks occurred, and Claude Opus 5.5 successfully completed 34 of the 50 tasks». El escaneo también ha dado cifras reales: los socios encontraron «at least 129,000 verified software vulnerabilities» entre abril y julio, Anthropic añadió «an additional 5,500» hasta octubre, y «more than 33,000» del total están calificadas como críticas o de gravedad alta. El aseguramiento de software suele significar confiar en la palabra de un proveedor. Esto es un proveedor publicando la tasa de bloqueo de su propio mecanismo de seguridad.

Un paper ha defendido que tu spec necesita una parte que se niegue a llamar a un modelo. Un envío a arXiv del 9 de octubre, «Implementing the Spec Growth Engine», propone dividir la verificación de specs en dos capas: un motor determinista que «validates the spec graph, compares it with the code’s import graph» y «classifies every change by what it can break… without calling a model», y una capa separada en la que «an intent author, a planner and a coder, each played by its own model» hacen crecer el grafo en rondas, comprobadas por «a deterministic rule» tras cada una. El paper es directo: «an autonomous run is worth only as much as the deterministic instance that measures it». Es el mismo argumento que lleva defendiendo todo el año la deriva de los agentes, ahora con nombre para la parte que debe quedarse fuera del criterio del modelo.

Cómo leerlo

El patrón que atraviesa las cuatro noticias es una decisión sobre qué trabajos no debe calificar nunca un modelo por su cuenta. Haiku 5.5 es lo bastante barato para absorber la carga repetitiva precisamente porque a nadie se le pide que sea la capa de criterio. El sandbox de Copilot y su puerta de aprobación para el uso del ordenador son dos intensidades de la misma idea: deja actuar al modelo, pero que la frontera a su alrededor sea otra cosa que su propio buen comportamiento. Los niveles del Programa de Verificación Cibernética son un proveedor admitiendo que «confía en el modelo» no es un nivel, una tasa de bloqueo medida sí lo es. El paper del Spec Growth Engine le da al mismo principio una forma formal: una capa determinista que comprueba, una capa de modelo que propone. Nada de esto argumenta contra la capacidad, sino que la capacidad y lo que la comprueba tienen que construirse por separado.

El ruido: leer el salto de Haiku 5.5 en los benchmarks como que los modelos pequeños «están alcanzando» el razonamiento de frontera. Los benchmarks que se han movido, OSWorld y Terminal-Bench, miden ejecutar rápido un flujo de trabajo ya conocido, no decidir cuál debería ser ese flujo. Esa es exactamente la brecha entre generar y juzgar que esta nota sigue rastreando.

Qué vigilar

Anthropic dice que sus Enterprise Frontier Safeguards, el mecanismo que condiciona el acceso de Amazon Bedrock al Programa de Verificación Cibernética, saldrán «later this fall». Ese es el detalle que merece revisarse en cuanto aparezca una fecha: un nivel de seguridad que existe en dos nubes y no en una tercera es una afirmación distinta de uno que existe en todas partes.