Resumen
Medimos cuánto le dice a un modelo de IA el nombre de una pieza, por sí solo, sobre dónde va esa pieza en nuestra arquitectura. A los modelos se les mostraron únicamente nombres de piezas y se les pidió colocar cada una en su capa. Con los nombres de hoy, el mejor modelo acertó el 59% y el modelo más potente solo el 39% — y peor: los dos modelos leyeron sistemáticamente la marca primitives- como una afirmación de que la pieza es fundacional, cosa falsa para la mayoría de ellas. El prefijo actual no solo deja de informar: desinforma activamente. Con nombres que llevan su capa como prefijo, los dos modelos sacaron 100%. La salvedad honesta: ese 100% es en parte por construcción (la respuesta está en el nombre) — pero eso es exactamente lo que se está midiendo: un nombre veraz no necesita contexto extra. El costo medido de los nombres de hoy es una tasa de falla de clasificación de entre 41% y 61% que hay que pagar con contexto del registro en cada uso.
Diagramas
flowchart LR L[verdad de layers.toml] --> SAMPLE[41 piezas, estratificadas,<br/>deterministas] SAMPLE --> A[Condición A:<br/>nombres actuales] SAMPLE --> B[Condición B:<br/>nombres con prefijo de capa] A --> H1[haiku: 24/41] & S1[sonnet: 16/41] B --> H2[haiku: 41/41] & S2[sonnet: 41/41] H1 & S1 & H2 & S2 --> V[veredicto: los nombres actuales<br/>desinforman; la marca se lee<br/>como una afirmación de fundación]
Método
Sprint 4.11 (corpus e2-name-comprehension, determinista y repetible): muestra estratificada de 41 piezas (hasta 4 por capa, en orden alfabético) tomada de layers.toml; la condición B renombra mecánicamente (<capa>-<sufijo>, con el prefijo de marca quitado); una llamada por lote por condición y por nivel de modelo (claude-haiku-4-5-20251001, claude-sonnet-5); la instrucción lleva ÚNICAMENTE los nombres y la lista cerrada de capas, con UNKNOWN permitido; el acierto se califica contra layers.toml.
Resultados
| condición | modelo | aciertos | segundos |
|---|---|---|---|
| actual | haiku | 24/41 (59%) | 36 |
| actual | sonnet | 16/41 (39%) | 7 |
| tier-true | haiku | 41/41 | 11 |
| tier-true | sonnet | 41/41 | 6 |
Hallazgos más allá del titular:
1. La marca desinforma. 28 de 82 respuestas con los nombres actuales fueron «foundation» — los modelos leen primitives- como una afirmación de clasificación. La falla no es ausencia de señal; es una señal falsa. 2. Ninguna negativa honesta. Cero UNKNOWN pese a estar disponible la opción; los dos niveles adivinaron. Sonnet además respondió seis veces con una capa que no estaba en la lista permitida («observability») — una violación de contrato que el formato por lotes no vigilaba renglón por renglón; queda anotado para endurecer el protocolo de la serie E. 3. La circularidad de la condición B, dicha sin rodeos: el nombre con prefijo de capa contiene su propia respuesta. Eso no es un defecto del experimento: es la tesis. Cuando el nombre es la clasificación, el modelo no necesita ningún registro en el contexto. La cantidad que se mide es la tasa de falla de la condición A — el impuesto de contexto que cobra el nombrado actual.
Telemetría
Serie e2-name-comprehension-2026-08-16 en run_measurement: cuatro renglones de acierto. Los tiempos de reloj están arriba. Las respuestas completas pieza por pieza están en el TSV de la corrida.
Qué se sigue
El lado de la comprensión en el intercambio del renombrado de primitives está medido: los nombres de hoy cuestan entre 41% y 61% de acierto solo-con-nombre y además afirman activamente una capa falsa. El lado del costo (el simulacro de crate_desired_state: el radio de impacto del renombrado en este repositorio y en los que lo consumen, con la compilación del árbol de trabajo exportado) es la medición que falta; la resolución entonces intercambia dos números.