El Reto · Arco Nivel 3 · guion de producción · CIERRE
El freno deja de ser mío y se vuelve del sistema
Arco de cierre. El freno deja de vivir en la cabeza de Roberto y se vuelve política del sistema: cualquier flujo nace protegido, y cuando algo se rompe una vez —learn-failures— no se puede volver a romper igual, sin que Roberto toque nada. Honesto: N3 no está "terminado". Pero el sistema sube la escalera solo y deja rastro de cada paso.
Formato: Podcast 16:9 + pantalla del substrato
Voces: Samantha + Roberto
Duración: ~9-10 min
API: 127.0.0.1:4000 en vivo
Las 3 reglas del panel de arquitectos — horneadas
Veredicto de la Junta (Cherny · Embiricos · Chase · Majors).
★ Harrison Chase
El ascenso es CONTROL, no autonomía. N3 = el sistema amplía su propio set de acciones (FORGE) pero cada capacidad nueva pasa por el build-gate. El punto más alto de control, no de libertad: el más capaz Y el más controlado a la vez.
★ Panel (consenso)
El evaluator nunca es la prueba durable. En N3 la prueba que sobrevive es el audit trail + learn-failures: registro independiente y durable. El evaluator es señal; el audit es la verdad.
★ Charity Majors + Boris Cherny
El protagonista es el audit atrapando un fallo NUEVO. No FORGE construyendo algo cool — es el sistema atrapando su propio unknown-unknown y dejando rastro de cómo decidió.
La tensión central — Embiricos ⚔ Charity
¿Sacaste al humano del loop?
Embiricos: N3 = sacar al humano del loop, su tesis hecha producto. Charity: si lo sacás, tu red de seguridad mejor que sea a prueba de las 3am.
La resolución (en cámara): el humano no desaparece — sube de revisor-por-paso a gobernador-de-políticas. No revisa cada entrega; define las reglas y aprueba cuando el sistema quiere construirse algo nuevo. La red del propio sistema (learn-failures + audit + build-gate) atrapa lo que el humano atrapaba.
El foso de Boris — lo permanente, no los parches
La gobernanza no es problema de capacidad del modelo, es accountability organizacional. Un modelo más inteligente sigue necesitando dejar rastro de por qué decidió — porque la pregunta es "¿quién es dueño cuando el agente la caga?" (Maven). Eso no lo borra el próximo modelo. FORGE impresiona; el audit trail es lo que dura.
El guion, beat por beat
Izquierda: lo que se dice. Derecha: lo que se ve en la pantalla del substrato.
0:00
COLD OPEN
cierre trilogía
Voz
SAMANTHA (off)En el nivel uno su sistema se equivocó y él no se enteró. En el nivel dos le puso el freno con su propia mano — y se volvió el cuello de botella. Hoy saca la mano.
ROBERTO (a cámara)Voy a sacar mi mano del sistema. No para que haga lo que quiera — para que se cuide solo, según las reglas que yo definí una vez. Si funciona, cualquiera de mi equipo suelta un agente y duerme tranquilo. Si no, lo vas a ver romperse. Como siempre.
CARD · NIVEL 3 · Gobernado — la confiabilidad es del sistema, no tuya
Pantallasubstrate // política de gobernanza activa
› el humano sube de altura
0:45
ACTO 1
el freno sale
de mi cabeza
Voz
SAMANTHALa vez pasada cada flujo nuevo nacía sin protección.
ROBERTOHasta que yo me acordara. Hoy lo invertí. Definí una política: cualquier trabajo que toque riesgo legal, plazos con cliente o dinero, nace con el freno puesto. No lo configuro yo. Es regla del sistema.
ROBERTO¿Te acordás de la propuesta que en el nivel dos se entregó con un plazo imposible? Mismo encargo, hoy. Nace con el freno. Yo no toqué nada. La diferencia entre una regla que vive en mi cabeza y una que vive en el sistema.
SAMANTHACerraste el agujero de cobertura.
ROBERTOPor política, no a mano. Pero eso es lo fácil del nivel tres. Lo que importa es qué pasa cuando se rompe algo que nunca anticipé.
Pantalla · misma propuesta de N2intent #0901 "borrador propuesta"
// política: toca plazo-cliente →
├─ redactar ✓
├─ evaluator.run ✓ auto
└─ awaiting_human ✓ auto
nació protegido. roberto: 0 toques.
3:00
★ MOMENTO HÉROE
Charity + Maven
learn-failures
Voz
ROBERTOAcá hay un error que yo nunca configuré. El agente cruzó datos de dos clientes. No tenía una regla que lo prohibiera — no se me había ocurrido que pasara.
SAMANTHAEntonces se entregó. Como en el nivel uno.
ROBERTONo. El sistema lo detectó, lo frenó, y —esto es lo nuevo— aprendió. learn-failures registró el fallo y agregó una restricción: "nunca cruces contexto entre clientes". Sola. Mirá si lo intento otra vez.
ROBERTOBloqueado. Yo no toqué una línea. Se rompió de una forma nueva, una vez, y se aseguró de no volver a romperse igual. Como un hijo al que le agregás reglas cada vez que encuentra una forma nueva de meterse en problemas — salvo que acá, el sistema se las agrega solo.
CARD · "Se rompió una vez. No se puede volver a romper igual. Y yo no toqué nada."
Pantalla · learn-failuresintent #0902 → FALLO NUEVO
cruce de contexto cliente A↔B
// no había regla para esto
learn-failures:
+ constraint "no cruzar contexto"
reintento #0903 → BLOQUEADO ✓
// roberto: 0 ediciones
5:15
★ EL FOSO
beat de Boris
¿quién es dueño?
Voz
SAMANTHAPero si el sistema decide y aprende solo... ¿cómo sabés por qué hizo lo que hizo?
ROBERTOEsa es LA pregunta de un manager de verdad. La que mata casi todos los proyectos de inteligencia artificial cuando llegan a legal o a un cliente enojado.
ROBERTOCada decisión deja un rastro hasta la fuente. "¿Por qué recomendó esto?" — y el sistema te lleva de la recomendación, paso por paso, hasta el dato exacto que la originó. Trazabilidad. Y lo importante para vos: esto no lo borra el próximo modelo.
SAMANTHA¿Por qué no?
ROBERTOPorque un modelo más inteligente no resuelve "¿quién es dueño cuando el agente la caga?". Esa no es pregunta de inteligencia. Es de responsabilidad. Y la responsabilidad necesita rastro, siempre. Es lo único del sistema que vale lo mismo hoy que en cinco años.
Pantalla · audit / data lineage› "¿por qué recomendó esto?"
audit trail:
recomendación
└→ regla aplicada
└→ dato fuente · doc#A-17
trazable de punta a punta
// sobrevive al próximo modelo
7:00
★ beat de Harrison
FORGE bajo
build-gate
Voz
SAMANTHA¿Y si el sistema necesita hacer algo que no sabe hacer?
ROBERTOSe lo construye. En vivo. Eso es lo que un chat de inteligencia artificial no te da: el sistema detecta que le falta una capacidad y se la fabrica. Pero no la usa hasta que pasa por acá.
ROBERTOConstruyó la herramienta, la probó en un sandbox, la trajo al gate. Y la primera versión la rechacé — tenía un error sutil. Ni lo que el sistema se construye a sí mismo escapa a la gobernanza. Eso es el nivel tres: no es que sea libre. Es el más capaz Y el más controlado a la vez.
SAMANTHAEntonces sí sacaste al humano del loop.
ROBERTOMe saqué del loop de revisar cada paso. Subí al loop de gobernar las reglas. No reviso cada entrega — defino políticas y apruebo cuando el sistema quiere construirse algo nuevo. El humano no desaparece. Cambia de altura.
Pantalla · FORGE → build-gateFORGE: capacidad faltante detectada
└→ construye → sandbox ✓
└→ build-gate:
v1 ✗ RECHAZADA (error sutil)
v2 ✓ aprobada
// ni la auto-extensión escapa al gate
8:45
CIERRE HONESTO
+ pregunta de
temporada
Voz
SAMANTHA¿Esto es el nivel tres, terminado?
ROBERTONo. Y no te lo voy a vender así. Todavía se rompen cosas. Pero la diferencia con el nivel uno es la única que importa: cuando se rompen, el sistema deja el rastro, aprende, y me rinde cuentas — en vez de entregar el error en silencio. Esa línea exacta separa un piloto de una plataforma.
SAMANTHAEn el episodio cero preguntaste si un manager, no un ingeniero, podía llevar un squad desde "rompe en producción" hasta "gobernado, confiable, a escala".
ROBERTOY no te lo afirmé. Te lo mostré. Peldaño por peldaño, con los fracasos a la vista. No llegué a un final perfecto. Llegué a un sistema que sube la escalera solo — y deja rastro de cada paso. Para un manager, eso no es un truco. Es un equipo en el que se puede confiar.
Pantallaescalera de madurez
▆ N1
▆ N2
▆ N3 ← subiendo, no terminado
deja rastro de cada paso
Voz
ROBERTOSi dirigís un equipo y miraste los tres niveles: no necesitás ser ingeniero para llegar acá. Necesitás entender la diferencia entre un agente que brilla y un sistema que rinde cuentas. Eso es lo que construimos. Y recién empieza.
SAMANTHASuscribite. La escalera sigue subiendo — y vos podés subirla con nosotros.
Pantallabrilla → rinde cuentas
esa es toda la serie.
Shorts feeders — 3 momentos, títulos quirúrgicos
1
learn-failures
"Mi agente de IA cometió un error nuevo. No volverá a cometerlo — y yo no toqué nada."
2
El audit · ¿quién es dueño?
"Cuando tu jefe pregunte 'por qué el agente decidió esto', esto es lo que necesitás tener."
3
FORGE bajo build-gate
"Mi sistema de IA se construye capacidades nuevas solo. Ninguna sale sin pasar por acá."
Pantalla del substrato: grabar contra 127.0.0.1:4000 — (a) la propuesta naciendo con freno por política; (b) learn-failures registrando un fallo nuevo + el reintento bloqueado; (c) el audit trazando una recomendación a su fuente; (d) FORGE → build-gate RECHAZANDO una versión. El reintento-bloqueado y el build-gate-rechazando son los dos beats que más venden — datos reales, no guionar (regla de Charity).
FORGE se mantiene SECUNDARIO a learn-failures/audit (regla 3 del panel). El héroe es el sistema atrapando su propio fallo, no construyendo algo cool. Si hay que recortar por tiempo, recortar FORGE antes que learn-failures.
Mostrar el build-gate RECHAZANDO, no solo aprobando (Boris: que no sea teatro de auto-extensión).
Cierre honesto: Roberto NO declara N3 terminado. El frame de temporada es el ascenso con fracasos a la vista, no la victoria.
Continuidad: reusar el caso de la propuesta de N2 para cerrar el loop del gap de cobertura.
Avatares HeyGen: Roberto look flagship estudio oscuro (e6a03653) + Samantha look aprobado. Correr avatar_qa tras render.