2026-08-18

El lenguaje como arquitectura — tesis v2

Estado: BORRADOR para revisión del operador. La v1 es docs/research/language-as-archetecture.md (la ortografía del nombre del archivo se conserva como historia); este archivo es la versión revisada, mantenida aparte por instrucción del operador. Nada de la v1 se edita.

Resumen

La v1 propuso que el lenguaje, la ontología y las restricciones participan en la arquitectura de software, y pidió experimentos falsables. La v2 revisa la afirmación central: pasa de «un vocabulario consistente reduce el contexto que necesita un modelo» a un enunciado más fuerte, y ahora medido: los nombres son entradas del modelo tratadas como hechos; un nombre engañoso es un defecto que inyecta hechos falsos en cada inferencia que lo toca, y el léxico es por tanto un componente del sistema, con sus propias pruebas, sus trinquetes y su maquinaria de refactorización. La reducción de contexto es un corolario, no la afirmación. La versión revisada se apoya en las mediciones de la serie E y en el ensayo de renombrado tier-true, todos ejecutados sobre este repositorio durante los sprints 4.8–4.12.

Qué cambió respecto a la v1

1. La v1 trataba el nombrado como un instrumento más entre varios. La v2 lo eleva: E2 mostró que el prefijo de marca no era neutral — los modelos lo leían como una afirmación arquitectónica («foundation») y respondían mal con seguridad. Nombrar mal no es información faltante; es desinformación. 2. La v1 pedía experimentos; la v2 tiene resultados. El registro de hipótesis de abajo anota cuáles de H1–H12 cuentan ya con evidencia de uso real (sin tráfico sintético, por regla del operador). 3. La v1 describía el cumplimiento en abstracto. La v2 nombra el mecanismo que funcionó: registros ratificados (semillas TSV de fuente única) que alimentan detectores mecánicos (D9–D14) con líneas base heredadas que solo pueden encoger, de modo que el estándar avanza a trinquete y nunca retrocede en silencio. 4. La v2 añade la refactorización como datos: un renombrado de todo el taller planeado como renglones de base de datos (antes/después por término en cada sitio), aplicado por un exportador que verifica antes de reemplazar dentro de un árbol de trabajo desechable, comprobado con sondas y repetible. El modo de falla es «renglón rechazado», nunca «edición equivocada en silencio».

Diagramas

El ciclo del vocabulario, tal como se opera:

flowchart LR
    M[medir en la base del corpus] --> R[el operador ratifica]
    R --> S[semilla TSV del registro]
    S --> D[detector D9-D14]
    D --> B[línea base que solo encoge]
    B --> W[cola de trabajo de relleno]
    W --> M

La tubería de renombrado-como-datos (ensayo del sprint 4.12):

flowchart LR
    CD[crate_desired_state] --> P[renglones del plan rename_edit]
    P --> X[exportador: verificar y luego reemplazar]
    X --> WT[árbol de trabajo desechable]
    WT --> PR[sondas: build, test, tools-doc-truth, check-deps]
    PR -->|rojo: clase de falla nueva| RL[regla añadida con prueba]
    RL --> P
    PR -->|verde| V[veredicto al operador; la fusión es la etapa 2]

Registro de hipótesis (numeración H de la v1, evidencia hasta hoy)

Hafirmación de la v1 (corta)EstadoEvidencia
H4enrutar por densidad de juicio, no por tamañoapoyadaE1: haiku 26s contra sonnet 109s en Q1, semilla de enrutamiento señalizada por calidad (docs/research/doc-audit-study-2026-08-16.md)
H7las fronteras mecánicas resisten la erosiónapoyadalayers.toml + check-deps; los trinquetes D10–D12 aguantaron todo el relleno
H8un léxico controlado reduce la abstracción inconsistenteapoyadael inventario de palabras pasó de 178 a 121 mecánicamente; D13, un sustantivo un referente, encontró el corpus vivo ya limpio
H10lo gobernado por el arnés le gana a lo no restringido con el tiempoparciallas líneas base del trinquete solo encogen a lo largo de los sprints 4.10–4.12; todavía no hay brazo de comparación controlado
H12la reparación semántica de deltas le gana a la regeneraciónapoyadaensayo de renombrado: 35,879 ediciones de sitio planeadas, los renglones viejos fallan en voz alta y se replanean, nada se regenera
otrasH1–H3, H5, H6, H9, H11sin probartodavía sin medición; candidatas para la serie E

Hipótesis nuevas (añadidas en la v2)

clasificación falsa degrada las respuestas del modelo por debajo de la línea base sin nombre. Medida una vez: E2, los nombres actuales dan 41–61% de acierto solo-con-nombre con lecturas erróneas sistemáticas de «foundation»; los nombres tier-true dan 100% en los dos niveles de modelo (docs/research/e2-name-comprehension-2026-08-16.md).

determinista + una puerta de sondas producen un refactor grande sin ninguna edición equivocada en silencio, a cambio de descubrir reglas de forma iterada. Midiéndose ahora: telemetría del ensayo, serie tier-true-rename-2026-08-16, nueve clases de falla cerradas cada una por una regla con prueba.

actualizadas únicamente a partir de corridas reales señalizadas por calidad convergen hacia modelos más baratos sin subir la tasa de rechazo. El arnés está construido (propose_routing); falta que se acumule.

Telemetría

Toda afirmación cuantitativa se rastrea hasta run_measurement en corpus_sourcecode (series: doc-audit-2026-08-16, e2-2026-08-16, tier-true-rename-2026-08-16) y hasta los documentos de estudio citados arriba. El control reservado para la afirmación central — las mismas tareas, nombres viejos contra nombres tier-true, midiendo el éxito de la tarea y el contexto consumido — está diseñado pero todavía no se ha corrido; es el experimento faltante más importante y bloquea cualquier versión de esta tesis con grado de revisión por pares.

Toda la investigación