DELIBERATE · Estado del arte

Décadas de teoría. Una conexión todavía por construir.

Los agentes LLM han aprendido a actuar, pero sus creencias siguen viviendo en contexto implícito. DELIBERATE investiga qué ocurre cuando conectamos esa capacidad generativa con planificación formal, argumentación computacional y revisión de creencias.

Selección conceptual, no revisión bibliográfica exhaustiva.

LA PREGUNTA De la acción a la deliberación

¿Cómo puede un agente sostener una conclusión durante meses sin perder por qué llegó a ella?

Buscar, llamar herramientas o encadenar pasos ya no es la frontera. El problema aparece cuando el agente debe conservar una posición, enfrentarla a evidencia nueva, reconocer conflictos y explicar cada revisión sin depender de que todo siga cabiendo en su ventana de contexto.

01

Agentes basados en LLM

La capacidad de razonar y actuar.

Chain-of-Thought mostró que hacer explícitos pasos intermedios mejora ciertas tareas de razonamiento. ReAct entrelazó razonamiento y acción; Toolformer exploró cómo aprender a utilizar herramientas. Esta corriente convirtió al modelo en agente, pero mantiene gran parte de su estado dentro de una secuencia textual.

Chain-of-ThoughtWei et al., 2022ReActYao et al., 2022ToolformerSchick et al., 2023

Lo que aporta: flexibilidad para interpretar, generar y actuar. Lo que deja abierto: memoria epistémica persistente y autoridad sobre el estado.

02

Planificación formal

Acciones con precondiciones y efectos.

STRIPS y PDDL establecieron una forma verificable de describir qué debe cumplirse antes de una acción, qué cambia después y cuándo termina un plan. Trabajos recientes como LLM+P, SayPlan o CALM recuperan esta separación para compensar la fragilidad de la planificación puramente generativa.

STRIPSFikes & Nilsson, 1971PDDLMcDermott et al., 1998Puentes LLM + planificaciónLLM+P · SayPlan · CALM

Lo que DELIBERATE adopta: operadores tipados, precondiciones, efectos declarados y un motor que conserva la autoridad sobre cada transición.

03

Argumentación formal

Creencias que pueden apoyarse, atacarse y revisarse.

Toulmin dio estructura interna al argumento. Dung formalizó relaciones de ataque y aceptabilidad. ASPIC+ añadió premisas, reglas y preferencias; la tradición AGM estudió cómo revisar creencias de forma no monótona, y Bench-Capon incorporó los valores que explican por qué dos agentes pueden evaluar de forma distinta los mismos hechos.

ToulminThe Uses of Argument, 1958DungAbstract Argumentation, 1995AGMAlchourrón, Gärdenfors & Makinson, 1985ASPIC+Modgil & Prakken, 2014

Lo que DELIBERATE adopta: un vocabulario epistémico para representar evidencia, conflicto, suficiencia y cambio de creencia sin reducirlos a texto persuasivo.

04

Argumentación cuantitativa

Resolver el grafo con una semántica gradual.

Los Quantitative Bipolar Argumentation Frameworks y semánticas como DF-QuAD permiten combinar apoyos y ataques para calcular grados de aceptabilidad. Trabajos recientes como ArgLLM aplican esta separación a salidas generadas por modelos de lenguaje: generación estocástica, resolución determinista.

QBAFBaroni, Rago & ToniDF-QuADRago et al.ArgLLMArgumentación cuantitativa aplicada a LLMs

El paso adicional de DELIBERATE: no resolver una estructura estática una sola vez, sino deliberar sobre sus déficits y revisar el estado cuando aparece evidencia nueva.

05

IA neurosimbólica

Aprender y razonar sin confundir ambas funciones.

DeepProbLog, NS-CL y Abductive Learning exploran distintas formas de combinar percepción o aprendizaje neural con conceptos y operaciones simbólicas. DELIBERATE comparte esa búsqueda, pero desplaza el foco hacia agentes persistentes: quién puede proponer, quién valida y cómo se conserva una historia auditable de cambios.

DeepProbLogManhaeve et al., 2018NS-CLMao et al., 2019Abductive LearningDai et al., 2019

El hueco

La teoría existe. Lo infrecuente es encontrarla reunida dentro de un agente LLM que opera en el tiempo.

El ecosistema agéntico moderno ha avanzado mediante prompting, herramientas y memoria textual. La argumentación formal, la revisión de creencias y la planificación verificable maduraron antes, en comunidades que rara vez diseñaban para LLMs. DELIBERATE explora el puente entre ambos mundos.

Capacidad generativa+Estado epistémico explícito+Autoridad simbólica+Deliberación dinámica

FinMate convierte esa investigación en un caso real: decisiones financieras personales, evidencia incompleta, cálculos reproducibles y una obligación práctica de explicar qué cambió y por qué.

HIPÓTESIS Posición de investigación

Un agente de larga duración no necesita únicamente más contexto. Necesita una representación explícita de lo que cree, una teoría para discutirlo y una autoridad distinta del LLM para cambiarlo.