El Reto · Arco Nivel 2 · guion de producción
El primer freno funciona… y yo soy el cuello de botella
Segundo arco. Le ponemos a UN flujo el primer freno —evaluator que levanta la mano + human-gate que detiene antes de entregar— y atrapamos el error que en N1 se entregó en silencio. Pero el freno es manual, flujo por flujo. La disciplina vive en la cabeza de Roberto. No escala.
Formato: Podcast 16:9 + pantalla del substrato
Voces: Samantha + Roberto
Duración: ~8-9 min
API: 127.0.0.1:4000 en vivo
↩ Continúa
el Arco Nivel 1 — mismo encargo, mismo anexo C faltante. Hoy lo instrumentamos.
Las 3 reglas del panel de arquitectos — horneadas
Veredicto de la Junta (Cherny · Embiricos · Chase · Majors).
★ Harrison Chase
El ascenso es CONTROL, no autonomía. N2 = su nivel 5: state machine con guardrails. Mismo poder que N1, ahora con un freno explícito — pero puesto a mano, en UN flujo.
★ Panel (consenso) — el punto de N2
El evaluator nunca va solo. Es el agente calificándose a sí mismo = el eslabón débil. Acá levanta la mano pero NO decide: emparejado con el human-gate, el chequeo independiente. Señal ≠ decisión.
★ Charity Majors
El protagonista es el momento en que el sistema SE DETIENE. En N1 el trace era autopsia. En N2 es el awaiting_human: frena antes de entregar. De autopsia a alarma.
El límite honesto de N2 — la tensión de Embiricos
⚠ El freno funciona. Y no escala.
El human-gate mete al humano de vuelta en el loop: cada entrega ahora espera a Roberto. Más seguro y el techo de escala.
El fallo honesto que se rompe en vivo: tras arreglar el flujo de riesgos, Roberto corre un segundo encargo distinto —"armá el borrador de la propuesta"— que nunca instrumentó. Sin gate. Promete un plazo imposible. Se entrega solo. Arreglaste UNA cosa. Tenés cincuenta.
El guion, beat por beat
Izquierda: lo que se dice. Derecha: lo que se ve en la pantalla del substrato.
0:00
COLD OPEN
continuidad N1
Voz
SAMANTHA (off)La vez pasada su sistema se equivocó y él no se enteró hasta que fue tarde. Hoy le pone el primer freno.
ROBERTO (a cámara)Va a funcionar. El freno va a atrapar el error que casi entregamos. Y aun así, al final del episodio, te voy a mostrar por qué todavía no puedo dormir tranquilo.
CARD · NIVEL 2 · Una cosa confiable — a la vez
Pantallasubstrate // flujo de N1 cargado
› mismo encargo · mismo dataset
0:35
ACTO 1
el primer freno
Voz
SAMANTHAMismo encargo que la vez pasada.
ROBERTOMismo encargo. Pero cambié el flujo. Agregué dos cosas: un segundo agente que revisa al primero —el evaluator— y un punto donde el sistema se detiene y me pregunta antes de entregar —el gate.
ROBERTOAntes el último paso era "entregar". Ahora es "esperá, que un humano mire". Eso es todo. Un freno. Pero cambia todo.
Pantalla · plan modificadointent #0512 "resume riesgos"
├─ clasificar riesgo ✓
├─ evaluator.run ← NUEVO
└─ awaiting_human ← NUEVO
(antes: entregar ✓)
2:30
★ panel · regla 2
la pregunta
incómoda
Voz
SAMANTHAPará. El evaluator es... ¿otro agente del mismo sistema revisando al primero? ¿No es el sistema calificándose a sí mismo?
ROBERTOEsa es LA pregunta. Y la respuesta es sí — y por eso no confío solo en él. Un agente calificando su propia tarea es el eslabón más débil de la cadena. Si fuera por el evaluator solo, estaríamos donde mismo.
SAMANTHA¿Entonces para qué lo ponés?
ROBERTOPorque el evaluator no decide. Levanta la mano. Mirá lo que dijo: "clasifiqué bajo, pero vi 'penalización' apuntando a un anexo que no tengo. Confianza: baja." No se corrigió solo. Me avisó que algo no cierra. Quien decide soy yo, en el gate. El evaluator es la señal. El humano es el freno. Nunca la misma cosa.
CARD · "El agente no se califica solo. Levanta la mano. Vos frenás."
Pantalla · evaluator.runevaluator → veredicto:
clase asignada: "bajo"
⚑ 'penalización' → anexo no cargado
confianza: BAJA
acción: elevar a human-gate
// el evaluator NO corrige.
// solo señala. el humano decide.
Voz
ROBERTOPido el anexo C. Ahí estaba la cláusula. Reclasifico: crítico. Y ahora sí, apruebo. El reporte que sale es correcto. El error que en el nivel uno se entregó en silencio, en el nivel dos lo atrapamos antes de que saliera.
SAMANTHAEntonces lo lograste. Una cosa confiable.
ROBERTOUna cosa confiable. Real. No de demo. Y si el episodio terminara acá, sería una mentira por omisión.
Pantalla · human-gatepaquete a revisar + señal evaluator
› roberto pide anexo_C ✓
› reclasifica → CRÍTICO
› aprueba ✓
entregado: correcto ✓
// 1 cosa confiable. real.
5:30
EL GIRO
HONESTO
gap de cobertura
Voz
ROBERTOPorque mientras grabábamos esto, me entró otro encargo. Distinto. "Armá el borrador de la propuesta para el cliente nuevo." Y lo dejé correr.
ROBERTOSin freno. Sin evaluator. Porque ese flujo no lo instrumenté. Y el borrador que salió le promete al cliente un plazo que no podemos cumplir. Se entregó solo. Otra vez.
SAMANTHAPero... vos sabés cómo ponerle el freno. Lo acabás de hacer.
ROBERTOSé cómo. Para el flujo de riesgos. Lo puse a mano, una vez. Pero ese freno vive en mi cabeza, no en el sistema. Cada flujo nuevo arranca de cero, sin protección, hasta que yo me acuerdo de instrumentarlo.
Pantalla · 2º intent (sin instrumentar)intent #0513 "borrador propuesta"
├─ redactar ✓
├─ evaluator: — ✗ no existe
├─ gate: — ✗ no existe
└─ entregar ✓ sin freno
output: plazo imposible prometido
7:00
★ beat de
Embiricos
el reencuadre
Voz
SAMANTHAO sea que el nivel dos no es "el sistema es confiable".
ROBERTOEs "puedo hacer UNA cosa confiable a la vez". Y hay dos problemas. Uno: tengo cincuenta flujos, no uno. Dos —y este duele— ahora yo soy el cuello de botella. Cada entrega del flujo bueno me espera a mí, en el gate. Le puse un freno tan dependiente de mí que el sistema no corre sin que yo mire.
SAMANTHAArreglaste la confiabilidad y rompiste la escala.
ROBERTOExacto. Y ese es el trabajo del nivel tres: que el freno deje de ser una regla que pongo a mano, y se vuelva una propiedad del sistema. Que cualquier flujo nazca protegido. Y que cuando algo se rompe una vez, no se pueda volver a romper igual — sin que yo toque nada.
Pantallaflujos instrumentados:
riesgos █ protegido (a mano)
propuesta ░ sin freno
+48 más ░ sin freno
cuello de botella: vos
Voz
ROBERTOSi dirigís un equipo: el nivel dos es donde la mayoría que llega hasta acá se queda. Una cosa que anda bien, sostenida con tu propia atención, que no escala. Funciona. Y te tiene de rehén. La próxima vez sacamos el freno de mi cabeza y lo metemos en el sistema.
SAMANTHASuscribite. El siguiente peldaño es el que casi nadie sube.
Pantallaescalera de madurez
▆ N1
▆ N2 ← estás acá
▆ N3
Shorts feeders — 3 momentos, títulos quirúrgicos
1
El freno se detiene
"Le puse UN freno a mi agente de IA. Funcionó. Y por eso no puedo dormir."
2
La pregunta incómoda
"Por qué un agente de IA no puede calificar su propia tarea (y qué hago en cambio)"
3
El gap de cobertura
"Hice UNA cosa confiable con IA. Tengo cincuenta flujos. Ahí está el problema."
Pantalla del substrato: grabar las DOS corridas reales contra 127.0.0.1:4000 — el flujo instrumentado (con evaluator.run + awaiting_human) deteniéndose, y el flujo NO instrumentado entregando sin freno. El contraste lado a lado es el corazón visual del episodio.
El evaluator se muestra SIEMPRE emparejado con el human-gate — nunca como héroe solitario (regla 2 del panel). Su output es una señal de confianza visible en el paquete que revisa el humano, no una decisión.
El segundo fallo (propuesta) se provoca con datos reales, no se guiona (regla de Charity, heredada de N1).
Continuidad: reusar el dataset de contratos de N1 (mismo anexo C) para que el espectador reconozca el caso.
Avatares HeyGen: Roberto look flagship estudio oscuro (e6a03653) + Samantha look aprobado. Correr avatar_qa tras render.