Volver a la edición
skim7 min

What Does Done Even Mean? Agents and Paperclip's Liveness Model - Dotta, Paperclip

Título original: What Does Done Even Mean? Agents and Paperclip's Liveness Model - Dotta, Paperclip

Dotta (creator, Paperclip) · AI Engineer

Una charla corta y densa sobre un modo de fallo que todos los constructores de agentes alcanzan: los agentes producen más trabajo del que alguien puede revisar, y 'hecho' se convierte silenciosamente en una mentira que el sistema se cuenta a sí mismo. Dotta reenmarca la finalización como un conjunto de aserciones — artefacto producido, evidencia adjunta, verificador separado del autor, propietario nombrado, siguiente paso definido — y muestra cómo el modelo de liveness de Paperclip mantiene el trabajo fluyendo sin ahogar a los humanos en colas de revisión. Termina con una lista de verificación que puedes aplicar a tu propio pipeline de agentes independientemente del arnés.

  • 'Hecho' no es un booleano; es una escalera — el productor lo afirma, un revisor lo verifica, se valida contra estándares, una persona autorizada lo aprueba, y sobrevive a condiciones del mundo real.
  • El compromiso central: demasiada autonomía produce basura, demasiada revisión produce colas improcesables. Diseña para liveness con bloqueadores explícitos, no aprobaciones generales.
  • Separa el verificador del autor — idealmente con un modelo diferente — y exige evidencia explícita de finalización en lugar del auto-informe del agente.
  • Dale a los agentes sus propias herramientas de verificación (navegadores, capturas de pantalla, ganchos personalizados) para que prueben su trabajo antes de que un humano lo vea.
Ver en YouTube

Parte de Edición Nº 001: LLMs para el juicio, código para contar: escalando a 500K sensores con 300x menos tokens