海量持续写入
线上 Trace 数据每小时可达 TB 级,累计增长至万亿条记录,给传统数据库的持续摄取能力带来压力。
将模型响应、工具调用、执行 Span 和应用事件统一存入基于 S3 的湖仓。把海量、持续演变的 JSON 转化为可查询、可用于评估的数据,无需维护碎片化的 Trace 处理链路。
了解方案架构{
"trace_id": "tr_8f2a",
"span": "agent.run",
"model": "reasoning-model",
"status": "completed",
"duration_ms": 2840
}以上为具体生产案例数据,取决于实际负载,不代表服务上限或性能承诺。
长时间运行的任务、分支工具调用、不断变化的 JSON。你的数据管道,需要跟上 Agent 的演进速度。
线上 Trace 数据每小时可达 TB 级,累计增长至万亿条记录,给传统数据库的持续摄取能力带来压力。
单个长时间运行的任务可能调用数千次工具、处理数百万上下文 Token,并生成复杂的多层级 Span。
每次模型或工具升级都可能引入新的 JSON 字段。如果摄取依赖固定 Schema,团队就需要频繁修改管道。
团队往往需要拼接 Kafka、Flink、Airflow、数据仓库和对象存储,导致链路变长,运维成本上升。
Databend Cloud 将原始 Trace 存储、增量 SQL 转换、任务调度与分析整合到一条托管管道中。在 S3 中保留完整执行上下文,仅处理新增事件,持续产出可用于评估、调试、回放、归因和训练的 Trace 数据模型。
通过 Kafka 等现有接入层采集 AI Agent 及 Web、应用事件。将 NDJSON 批量文件写入 S3 Stage,再由加载 Task 执行 COPY INTO 和 JSON 清洗,导入原始事件。
左右滑动,查看完整架构图。
通过 Kafka 等现有接入层采集 AI Agent 及 Web、应用事件。将 NDJSON 批量文件写入 S3 Stage,再由加载 Task 执行 COPY INTO 和 JSON 清洗,导入原始事件。
使用原生 VARIANT 在 events 表中保留完整的异构 JSON。通过计算列提取高频查询字段,并使用聚簇和倒排索引支持检索,无需丢弃原始数据。
Stream 捕获新增行,Task 执行增量 SQL,完成字段提取、Span 标准化与信息补充,通过 MERGE INTO 更新 Trace 模型并刷新聚合,无需反复转换全部历史数据。
查询 Trace 模型,支持调试、评估、回放、归因,以及训练和强化学习数据准备。通过独立弹性计算集群隔离摄取、转换、分析和重新聚簇等负载。
通过并行加载和工作节点水平扩展,支持每小时 TB 级的 Trace 摄取。在 Agent 流量与 Trace 数据量增长时保持稳定写入。
保留持续变化、深度嵌套的 JSON,再提取和搜索重要字段,无需为每次 Schema 变化重建管道。
使用 Stream 和 Task 在数据库内完成处理与调度,无需单独维护 Flink 或 Airflow 管道。独立计算集群隔离负载,托管服务缩短生产落地周期。
将完整原始 Trace 存入客户可控的湖仓,自主定义保留期限、字段提取规则,以及每个 Agent 和应用的分析模型。
| 核心能力 | 解决的问题 |
|---|---|
| 原生 VARIANT | 保留深度嵌套、持续演变的 JSON,无需预先定义全部字段。 |
| Stream + Task | 通过增量 SQL 管道处理新到达的事件。 |
| Cluster Key + Recluster | 按时间和 trace_id 检索长时间运行的 Trace 时,减少数据扫描。 |
| 弹性计算集群 | 隔离摄取、转换、查询和维护负载。 |
| 基于 S3 的存储 | 支持客户自主定义保留策略与历史数据重处理。 |
| PrivateLink + 数据脱敏 | 保护敏感提示词、模型输出和应用数据。 |
保留完整执行历史,构建可复用的数据集,帮助工程与模型团队持续改进 Agent。
通过 trace_id 重建模型调用、工具调用、决策和并行分支。
定位问题根因将生产 Trace 转换为用于回归测试和模型对比的数据集。
衡量每一次变化利用保留的执行上下文排查失败原因,验证模型、提示词、工具和 Agent 运行框架的变更。
从失败中学习将质量、成本和延迟关联到产生这些结果的决策与组件。
关联原因与结果将成功执行路径转化为结构化数据资产,用于后训练和强化学习。
支持下一轮迭代Agent Trace 数据管道记录 AI Agent 的完整执行历史,并将其转化为可查询、可复用的数据。这些数据包括模型输入与输出、工具调用、检索步骤、状态变化、Token 用量、中间结果、错误和最终结果。与基础日志管道不同,它需要支持长时间运行和分支执行、持续变化的 JSON 结构、增量转换,以及评估、回放、归因和训练等下游工作流。Databend Cloud 在统一的 S3 数据底座上提供所需的存储、处理、调度与分析能力。
Langfuse 是面向大模型工程与可观测性的平台。其自托管部署包括 PostgreSQL、ClickHouse、Redis 或 Valkey、对象存储和应用容器;Langfuse Cloud 托管这些基础设施,保留期限和用量规则由当前套餐决定。Databend Cloud 侧重大规模 Agent Trace 的底层数据管道:在客户可控的湖仓中使用原生 VARIANT 存储,通过 SQL 定义 JSON 提取和分析模型,进行增量处理,并隔离不同计算负载。它为调试和评估工作流提供数据基础,而不是对 Langfuse 全部应用功能的逐项替代。具体部署要求与套餐信息请参考双方最新文档。
可以。Databend Cloud 使用原生 VARIANT 数据类型存储原始 JSON,包括嵌套对象和数组。团队无需在摄取前定义所有可能出现的字段,可以保留原始数据,用 SQL 提取高频查询字段,并随 Agent、模型、工具和 Trace 格式的变化更新转换逻辑。这将可靠的数据摄取与下游建模分离,避免每次上游 JSON 变化都立即触发管道迁移。
Stream 跟踪原始 Trace 表中尚未消费的变更,Task 按计划或在有新行可用时执行 SQL。二者配合,仅处理新到达的数据,即可提取 JSON 字段、统一事件名称、补充 Span 信息、更新明细表并生成聚合,避免反复扫描和转换全部历史数据。原始记录仍然保留,可在分析需求变化时用于审计、回放和重处理。
核心 Trace 转换管道不需要。Databend Cloud 可以接入 Kafka 或对象存储等现有摄取层,在一个托管服务中完成原始数据保留、增量 SQL 转换、任务调度、分析建模与查询。团队仍可按架构需求保留外部系统,但不必在原始 Trace 摄取与分析数据产出之间的每个阶段都部署独立引擎。
基于 AWS S3 的统一数据底座。
从执行事件,走向调试、评估、回放、归因与训练。