# Agent Trace 数据管道解决方案 | Databend Cloud

> 在一个基于 S3 的湖仓中完成生产级 Agent Trace 的摄取、转换、保留与分析，将持续演变的 JSON 转化为可查询、可用于评估的数据。

Canonical: https://www.databend.cn/solutions/agent-trace/
Language: zh-CN

## 面向生产环境的 Agent Trace 数据管道

将模型响应、工具调用、执行 Span 和应用事件统一存入基于 S3 的湖仓。把海量、持续演变的 JSON 转化为可查询、可用于评估的数据，无需维护碎片化的 Trace 处理链路。

[免费开始](https://app.databend.cn/register) · [联系销售](https://www.databend.cn/contact-us/)

## 经过生产环境验证

已在头部大模型企业的生产环境中验证。

- **TB 级 每小时**: 生产环境 Trace 摄取峰值
- **万亿级 记录**: 累计 Trace 数据规模
- **10 万+ Span**: 单条 Trace 包含的 Span 数量
- **500 MB 单条 Trace**: 案例中观测到的最大单条 Trace

以上为具体生产案例数据，取决于实际负载，不代表服务上限或性能承诺。

[阅读客户案例](https://www.databend.cn/blog/category-customer/agent-trace-pipeline/)

## 01 / 业务挑战

### 海量持续写入

线上 Trace 数据每小时可达 TB 级，累计增长至万亿条记录，给传统数据库的持续摄取能力带来压力。

### 深度嵌套的 Trace

单个长时间运行的任务可能调用数千次工具、处理数百万上下文 Token，并生成复杂的多层级 Span。

### 持续变化的数据结构

每次模型或工具升级都可能引入新的 JSON 字段。如果摄取依赖固定 Schema，团队就需要频繁修改管道。

### 碎片化的数据链路

团队往往需要拼接 Kafka、Flink、Airflow、数据仓库和对象存储，导致链路变长，运维成本上升。

## 完整参考架构

Databend Cloud 将原始 Trace 存储、增量 SQL 转换、任务调度与分析整合到一条托管管道中。在 S3 中保留完整执行上下文，仅处理新增事件，持续产出可用于评估、调试、回放、归因和训练的 Trace 数据模型。

参考流程：Agent / 应用事件 → Kafka → S3 Stage → 加载 Task → events（VARIANT）→ Stream → Task → traces → 数据应用。Kafka 仅为接入层示例，并非必需组件。

AI Agent 与 Web、应用事件经 Kafka 写入 S3 Stage。加载 Task 使用 COPY INTO 和 JSON 清洗，将事件存为 VARIANT，并结合计算列、聚簇与倒排索引。Stream 捕获新增行；Task 执行 MERGE INTO 并刷新聚合，生成支持调试、评估、回放、归因、训练与强化学习的 Trace 模型。独立弹性计算集群隔离摄取、转换、分析和重新聚簇负载。移动虚线仅表示数据流向，不代表实际吞吐量。

### 1. 摄取

Kafka / S3 Stage / COPY INTO

通过 Kafka 等现有接入层采集 AI Agent 及 Web、应用事件。将 NDJSON 批量文件写入 S3 Stage，再由加载 Task 执行 COPY INTO 和 JSON 清洗，导入原始事件。

输出: 持久保存、可供处理的原始事件

### 2. 保留

VARIANT / 计算列

使用原生 VARIANT 在 events 表中保留完整的异构 JSON。通过计算列提取高频查询字段，并使用聚簇和倒排索引支持检索，无需丢弃原始数据。

输出: 基于 S3 存储的完整执行上下文

### 3. 转换

Stream / Task / MERGE INTO

Stream 捕获新增行，Task 执行增量 SQL，完成字段提取、Span 标准化与信息补充，通过 MERGE INTO 更新 Trace 模型并刷新聚合，无需反复转换全部历史数据。

输出: 可查询、可用于评估的 Trace 数据

### 4. 分析与改进

SQL / 独立计算集群

查询 Trace 模型，支持调试、评估、回放、归因，以及训练和强化学习数据准备。通过独立弹性计算集群隔离摄取、转换、分析和重新聚簇等负载。

输出: 可供下一轮模型迭代复用的数据集

[完整参考架构](https://www.databend.cn/solutions/agent-trace/#architecture)

## 统一托管数据管道

### 随 Agent 负载弹性扩展

通过并行加载和工作节点水平扩展，支持每小时 TB 级的 Trace 摄取。在 Agent 流量与 Trace 数据量增长时保持稳定写入。

### 灵活应对数据演变

保留持续变化、深度嵌套的 JSON，再提取和搜索重要字段，无需为每次 Schema 变化重建管道。

### 统一的托管数据管道

使用 Stream 和 Task 在数据库内完成处理与调度，无需单独维护 Flink 或 Airflow 管道。独立计算集群隔离负载，托管服务缩短生产落地周期。

### 自主掌控 Trace 数据

将完整原始 Trace 存入客户可控的湖仓，自主定义保留期限、字段提取规则，以及每个 Agent 和应用的分析模型。

## 核心能力

| 核心能力 | 解决的问题 |
| --- | --- |
| 原生 VARIANT | 保留深度嵌套、持续演变的 JSON，无需预先定义全部字段。 |
| Stream + Task | 通过增量 SQL 管道处理新到达的事件。 |
| Cluster Key + Recluster | 按时间和 trace_id 检索长时间运行的 Trace 时，减少数据扫描。 |
| 弹性计算集群 | 隔离摄取、转换、查询和维护负载。 |
| 基于 S3 的存储 | 支持客户自主定义保留策略与历史数据重处理。 |
| PrivateLink + 数据脱敏 | 保护敏感提示词、模型输出和应用数据。 |

[了解 Databend Cloud](https://www.databend.cn/databend-cloud/)

## 应用场景

### 调试完整 Agent 执行

通过 trace_id 重建模型调用、工具调用、决策和并行分支。

### 构建持续评估

将生产 Trace 转换为用于回归测试和模型对比的数据集。

### 回放关键执行过程

利用保留的执行上下文排查失败原因，验证模型、提示词、工具和 Agent 运行框架的变更。

### 分析结果归因

将质量、成本和延迟关联到产生这些结果的决策与组件。

### 准备训练与强化学习数据

将成功执行路径转化为结构化数据资产，用于后训练和强化学习。

[阅读技术实践](https://www.databend.cn/blog/category-engineering/kafka-agent-trace-ingestion/)

## 常见问题

### 什么是 Agent Trace 数据管道？

Agent Trace 数据管道记录 AI Agent 的完整执行历史，并将其转化为可查询、可复用的数据。这些数据包括模型输入与输出、工具调用、检索步骤、状态变化、Token 用量、中间结果、错误和最终结果。与基础日志管道不同，它需要支持长时间运行和分支执行、持续变化的 JSON 结构、增量转换，以及评估、回放、归因和训练等下游工作流。Databend Cloud 在统一的 S3 数据底座上提供所需的存储、处理、调度与分析能力。

### Databend Cloud 与 Langfuse 有什么不同？

Langfuse 是面向大模型工程与可观测性的平台。其自托管部署包括 PostgreSQL、ClickHouse、Redis 或 Valkey、对象存储和应用容器；Langfuse Cloud 托管这些基础设施，保留期限和用量规则由当前套餐决定。Databend Cloud 侧重大规模 Agent Trace 的底层数据管道：在客户可控的湖仓中使用原生 VARIANT 存储，通过 SQL 定义 JSON 提取和分析模型，进行增量处理，并隔离不同计算负载。它为调试和评估工作流提供数据基础，而不是对 Langfuse 全部应用功能的逐项替代。具体部署要求与套餐信息请参考双方最新文档。

### Databend Cloud 能处理深度嵌套且持续变化的 JSON 吗？

可以。Databend Cloud 使用原生 VARIANT 数据类型存储原始 JSON，包括嵌套对象和数组。团队无需在摄取前定义所有可能出现的字段，可以保留原始数据，用 SQL 提取高频查询字段，并随 Agent、模型、工具和 Trace 格式的变化更新转换逻辑。这将可靠的数据摄取与下游建模分离，避免每次上游 JSON 变化都立即触发管道迁移。

### Databend Cloud 如何增量处理新增 Trace 数据？

Stream 跟踪原始 Trace 表中尚未消费的变更，Task 按计划或在有新行可用时执行 SQL。二者配合，仅处理新到达的数据，即可提取 JSON 字段、统一事件名称、补充 Span 信息、更新明细表并生成聚合，避免反复扫描和转换全部历史数据。原始记录仍然保留，可在分析需求变化时用于审计、回放和重处理。

### 这套方案需要单独部署 ETL 和编排系统吗？

核心 Trace 转换管道不需要。Databend Cloud 可以接入 Kafka 或对象存储等现有摄取层，在一个托管服务中完成原始数据保留、增量 SQL 转换、任务调度、分析建模与查询。团队仍可按架构需求保留外部系统，但不必在原始 Trace 摄取与分析数据产出之间的每个阶段都部署独立引擎。

## 构建生产级 Agent Trace 数据管道。

基于 AWS S3 的统一数据底座。 从执行事件，走向调试、评估、回放、归因与训练。

[免费开始](https://app.databend.cn/register) · [联系销售](https://www.databend.cn/contact-us/)
