LLM日志记录捕捉提示和完成——关于发生了什么的描述性数据。决策追踪捕捉决策做出的原因——带有支持/反对论点、先例和理由的结构化推理。日志记录支持调试。决策追踪支持机构记忆、先例搜索和可解释的AI。AI Agentree提供了日志无法替代的决策追踪层。
TL;DR: 日志记录捕捉模型所说的内容。决策追踪捕捉决策背后的原因。只有一个能够启用先例和机构记忆。
日志记录是必要的,但不够。这里是它缺少的内容。
描述性: "发生了这个"
// Log entry
{
"prompt": "Should we approve...",
"completion": "Yes, approved...",
"tokens": 847,
"latency_ms": 1234
}
你可以找到这个日志。但你能找到你是如何决定类似案例的吗?
规范性: "这是支持/反对因为..."
// Decision trace
{
"decision": "APPROVED",
"pro_arguments": [...],
"con_arguments": [...],
"precedent_cited": "D-1234",
"rationale_ids": [...]
}
可通过推理模式查询。可作为先例引用。
| 方面 | LLM日志记录 | 决策追踪 |
|---|---|---|
| 它捕获了什么 | 提示、完成、令牌、延迟 | 推理结构、先例、理由 |
| 数据结构 | 非结构化文本、扁平元数据 | 结构化论证树、规范关系 |
| 查询能力 | '查找包含X的日志' | '根据推理模式查找与Y相似的决策' |
| 支持先例 | ||
| 机构记忆 | ||
| 可解释性 | 显示模型所说的内容 | 显示为何做出该决策 |
| 合规价值 | 事件的审计轨迹 | 推理的审计轨迹 |
"我们是如何处理类似的退款请求的?" 需要推理结构,而不是文本搜索。日志找到匹配的词。痕迹找到匹配的模式。
随着时间的推移积累的知识需要结构化的决策。日志是考古学。痕迹是建筑学。
引用过去决策的代理需要结构化的先例。"我们在类似条件下批准了 D-1234" 需要决策痕迹。
"为什么 AI 决定 X?" 需要结构化的理由。思维链是事后分析。决策痕迹是真实依据。
跟踪哪些推理模式导致良好结果需要结构。日志无法将论点与结果关联。
从人类参与到完全自主需要证据。决策痕迹证明决策质量。日志证明执行。
LLM日志捕获提示、完成和元数据(令牌、延迟)。决策追踪捕获结构化推理:支持/反对论点、引用的先例、信心水平以及推动决策的理由。日志是描述性的;追踪是规范性的。
提示/输出日志无法捕获推理结构。你无法从原始文本日志中查询“我们是如何处理类似案例的?”或“什么先例支持这个决定?”决策追踪创建结构化的文档,使得先例搜索和机构记忆成为可能。
不一样。思维链是模型事后生成的——它并不忠实于内部计算。两个提示可以产生相同的答案,但有不同的“解释”。决策追踪在决策时捕获结构化文档,而不是重构的叙述。
不有效。先例需要规范关系(支持/反对),而不是描述性关系(包含/提及)。基于日志的搜索找到相似文本;决策追踪找到相似的推理模式。这个区别是根本性的。
是的。保留你的日志以进行调试、成本跟踪和合规性。添加决策追踪以提高可解释性、先例和机构记忆。它们服务于不同的目的并协同工作。
法规越来越要求解释AI决策。日志显示模型所说的内容。决策追踪显示为什么做出这个决定,考虑了哪些替代方案,以及支持它的证据。这正是审计员和监管者实际需要的。
捕捉你的AI决定的原因,而不仅仅是它所说的内容。