已上架
跳到主要内容
AGENT TRACE 解决方案

面向生产环境的
Agent Trace
数据管道

将模型响应、工具调用、执行 Span 和应用事件统一存入基于 S3 的湖仓。把海量、持续演变的 JSON 转化为可查询、可用于评估的数据,无需维护碎片化的 Trace 处理链路。

了解方案架构
Trace 追踪示例数据
TRACE IDtr_8f2a
已完成
执行 Span0 — 2.84 s
Agent 执行VARIANT
{
  "trace_id": "tr_8f2a",
  "span": "agent.run",
  "model": "reasoning-model",
  "status": "completed",
  "duration_ms": 2840
}
完整保留每个 Span,灵活查询每个字段。点击 Span 查看详情
基于 S3 的湖仓 原生 JSON,标准 SQL 数据与保留策略,自主掌控
经过生产环境验证

已在头部大模型企业的生产环境中验证。

阅读客户案例
生产环境 Trace 摄取峰值
TB 级每小时
累计 Trace 数据规模
万亿级记录
单条 Trace 包含的 Span 数量
10 万+Span
案例中观测到的最大单条 Trace
500 MB单条 Trace

以上为具体生产案例数据,取决于实际负载,不代表服务上限或性能承诺。

01 / 业务挑战

Agent Trace
不只是应用日志。

长时间运行的任务、分支工具调用、不断变化的 JSON。你的数据管道,需要跟上 Agent 的演进速度。

01

海量持续写入

线上 Trace 数据每小时可达 TB 级,累计增长至万亿条记录,给传统数据库的持续摄取能力带来压力。

02

深度嵌套的 Trace

单个长时间运行的任务可能调用数千次工具、处理数百万上下文 Token,并生成复杂的多层级 Span。

03

持续变化的数据结构

每次模型或工具升级都可能引入新的 JSON 字段。如果摄取依赖固定 Schema,团队就需要频繁修改管道。

04

碎片化的数据链路

团队往往需要拼接 Kafka、Flink、Airflow、数据仓库和对象存储,导致链路变长,运维成本上升。

02 / 统一数据底座

从 Agent 执行
到模型持续改进。

Databend Cloud 将原始 Trace 存储、增量 SQL 转换、任务调度与分析整合到一条托管管道中。在 S3 中保留完整执行上下文,仅处理新增事件,持续产出可用于评估、调试、回放、归因和训练的 Trace 数据模型。

Databend Cloud统一托管数据管道
Kafka / S3 Stage / COPY INTO

摄取

通过 Kafka 等现有接入层采集 AI Agent 及 Web、应用事件。将 NDJSON 批量文件写入 S3 Stage,再由加载 Task 执行 COPY INTO 和 JSON 清洗,导入原始事件。

输出持久保存、可供处理的原始事件
独立弹性计算集群摄取 · 转换 · 分析 · 重新聚簇自动扩缩容 / 自动挂起

完整参考架构

Agent Trace 数据管道已启用减少动态效果

左右滑动,查看完整架构图。

Databend Cloud Agent Trace 参考架构AI Agent 与 Web、应用事件经 Kafka 写入 S3 Stage。加载 Task 使用 COPY INTO 和 JSON 清洗,将事件存为 VARIANT,并结合计算列、聚簇与倒排索引。Stream 捕获新增行;Task 执行 MERGE INTO 并刷新聚合,生成支持调试、评估、回放、归因、训练与强化学习的 Trace 模型。独立弹性计算集群隔离摄取、转换、分析和重新聚簇负载。移动虚线仅表示数据流向,不代表实际吞吐量。基于 S3 的存储 · 增量 SQL · 独立计算托管数据管道数据来源数据接入加载与保留新增事件数据应用AI AgentWeb / 应用事件KafkaTrace /SpanS3 StageNDJSON批量文件加载 TaskCOPY INTO +JSON 清洗eventsVARIANT + 计算列聚簇 + 倒排索引Stream捕获新增行TaskMERGE INTO刷新聚合traces可用于评估的 Trace 模型回放 + 归因调试评估回放归因训练 / 强化学习摄取 · 转换 · 分析 · 重新聚簇自动扩缩容 · 负载隔离 · 自动挂起箭头表示数据流向。Kafka 仅为接入层示例,并非必需组件。
参考流程:Agent / 应用事件 → Kafka → S3 Stage → 加载 Task → events(VARIANT)→ Stream → Task → traces → 数据应用。Kafka 仅为接入层示例,并非必需组件。
  1. 摄取

    通过 Kafka 等现有接入层采集 AI Agent 及 Web、应用事件。将 NDJSON 批量文件写入 S3 Stage,再由加载 Task 执行 COPY INTO 和 JSON 清洗,导入原始事件。

  2. 保留

    使用原生 VARIANT 在 events 表中保留完整的异构 JSON。通过计算列提取高频查询字段,并使用聚簇和倒排索引支持检索,无需丢弃原始数据。

  3. 转换

    Stream 捕获新增行,Task 执行增量 SQL,完成字段提取、Span 标准化与信息补充,通过 MERGE INTO 更新 Trace 模型并刷新聚合,无需反复转换全部历史数据。

  4. 分析与改进

    查询 Trace 模型,支持调试、评估、回放、归因,以及训练和强化学习数据准备。通过独立弹性计算集群隔离摄取、转换、分析和重新聚簇等负载。

随 Agent 负载弹性扩展

通过并行加载和工作节点水平扩展,支持每小时 TB 级的 Trace 摄取。在 Agent 流量与 Trace 数据量增长时保持稳定写入。

灵活应对数据演变

保留持续变化、深度嵌套的 JSON,再提取和搜索重要字段,无需为每次 Schema 变化重建管道。

统一的托管数据管道

使用 Stream 和 Task 在数据库内完成处理与调度,无需单独维护 Flink 或 Airflow 管道。独立计算集群隔离负载,托管服务缩短生产落地周期。

自主掌控 Trace 数据

将完整原始 Trace 存入客户可控的湖仓,自主定义保留期限、字段提取规则,以及每个 Agent 和应用的分析模型。

03 / 核心能力

为生产环境构建,
不止于演示。

Trace 管道所需的存储、处理和治理能力,统一集成于 Databend Cloud。

了解 Databend Cloud
Databend Cloud 面向 Agent Trace 管道的核心能力
核心能力解决的问题
原生 VARIANT保留深度嵌套、持续演变的 JSON,无需预先定义全部字段。
Stream + Task通过增量 SQL 管道处理新到达的事件。
Cluster Key + Recluster按时间和 trace_id 检索长时间运行的 Trace 时,减少数据扫描。
弹性计算集群隔离摄取、转换、查询和维护负载。
基于 S3 的存储支持客户自主定义保留策略与历史数据重处理。
PrivateLink + 数据脱敏保护敏感提示词、模型输出和应用数据。
04 / 释放 TRACE 数据价值

每一次执行,
都是改进的机会。

保留完整执行历史,构建可复用的数据集,帮助工程与模型团队持续改进 Agent。

01

调试完整 Agent 执行

通过 trace_id 重建模型调用、工具调用、决策和并行分支。

定位问题根因
02

构建持续评估

将生产 Trace 转换为用于回归测试和模型对比的数据集。

衡量每一次变化
03

回放关键执行过程

利用保留的执行上下文排查失败原因,验证模型、提示词、工具和 Agent 运行框架的变更。

从失败中学习
04

分析结果归因

将质量、成本和延迟关联到产生这些结果的决策与组件。

关联原因与结果
05

准备训练与强化学习数据

将成功执行路径转化为结构化数据资产,用于后训练和强化学习。

支持下一轮迭代
05 / 常见问题

更多问题,
在这里解答。

进一步了解支撑 Agent 的数据底座。

获取 Markdown 版本
什么是 Agent Trace 数据管道?

Agent Trace 数据管道记录 AI Agent 的完整执行历史,并将其转化为可查询、可复用的数据。这些数据包括模型输入与输出、工具调用、检索步骤、状态变化、Token 用量、中间结果、错误和最终结果。与基础日志管道不同,它需要支持长时间运行和分支执行、持续变化的 JSON 结构、增量转换,以及评估、回放、归因和训练等下游工作流。Databend Cloud 在统一的 S3 数据底座上提供所需的存储、处理、调度与分析能力。

Databend Cloud 与 Langfuse 有什么不同?

Langfuse 是面向大模型工程与可观测性的平台。其自托管部署包括 PostgreSQL、ClickHouse、Redis 或 Valkey、对象存储和应用容器;Langfuse Cloud 托管这些基础设施,保留期限和用量规则由当前套餐决定。Databend Cloud 侧重大规模 Agent Trace 的底层数据管道:在客户可控的湖仓中使用原生 VARIANT 存储,通过 SQL 定义 JSON 提取和分析模型,进行增量处理,并隔离不同计算负载。它为调试和评估工作流提供数据基础,而不是对 Langfuse 全部应用功能的逐项替代。具体部署要求与套餐信息请参考双方最新文档。

Databend Cloud 能处理深度嵌套且持续变化的 JSON 吗?

可以。Databend Cloud 使用原生 VARIANT 数据类型存储原始 JSON,包括嵌套对象和数组。团队无需在摄取前定义所有可能出现的字段,可以保留原始数据,用 SQL 提取高频查询字段,并随 Agent、模型、工具和 Trace 格式的变化更新转换逻辑。这将可靠的数据摄取与下游建模分离,避免每次上游 JSON 变化都立即触发管道迁移。

Databend Cloud 如何增量处理新增 Trace 数据?

Stream 跟踪原始 Trace 表中尚未消费的变更,Task 按计划或在有新行可用时执行 SQL。二者配合,仅处理新到达的数据,即可提取 JSON 字段、统一事件名称、补充 Span 信息、更新明细表并生成聚合,避免反复扫描和转换全部历史数据。原始记录仍然保留,可在分析需求变化时用于审计、回放和重处理。

这套方案需要单独部署 ETL 和编排系统吗?

核心 Trace 转换管道不需要。Databend Cloud 可以接入 Kafka 或对象存储等现有摄取层,在一个托管服务中完成原始数据保留、增量 SQL 转换、任务调度、分析建模与查询。团队仍可按架构需求保留外部系统,但不必在原始 Trace 摄取与分析数据产出之间的每个阶段都部署独立引擎。

从原始事件,走向下一轮迭代

构建生产级
Agent Trace 数据管道。

基于 AWS S3 的统一数据底座。
从执行事件,走向调试、评估、回放、归因与训练。

全托管服务 原生 SQL 数据自主可控
北京市海淀区知春路紫金数码园 3 号楼 1010
电话:185 1688 8139
Databend 公众号
销售微信
© 2026 Databend Cloud。版权所有。
SOC 2 Type IIGDPR