Databend 开源周报第 113 期
Databend Labs10月 2, 2023
英文版移步:https://www.databend.com/blog/2023-10-01-databend-weekly
Databend 是一款现代云数仓。专为弹性和高效设计,为您的大规模分析需求保驾护航。自由且开源。即刻体验云服务:https://app.databend.cn 。
What's On In Databend
探索 Databend 本周新进展,遇到更贴近你心意的 Databend。
数据导入具有额外列的表
默认情况下,
COPY INTO
如果表中的列数大于文件中的字段数,可以手动指定需要导入数据的列来保证对齐。
而在导入 CSV 格式的数据文件时,如果表中的列数大于文件中的字段数,且额外列位于表的末尾,则可以使用
FILE_FORMAT
ERROR_ON_COLUMN_COUNT_MISMATCH
如果您想了解更多信息,请查看下面列出的资源。
Code Corner
一起来探索 Databend 和周边生态中的代码片段或项目。
为 ParquetReader 设计读策略
直接使用
arrow-rs
为了改善 row group 的读逻辑并且重用上一个阶段中的预取数据,我们对相关逻辑进行了大量的重构并且引入了读策略进行解耦。
NoPrefetchPoliy
没有预取阶段。直接读、反序列化并输出你需要的数据块。
PredicateAndTopkPolicy
在预取阶段预取 prewhere 和 topk 需要的列。它们反序列化为
DataBlock
RowSelection
DataBlock
VecDeque
在最后阶段读取
RowSelection
DataBlocks
output_schema
TopkOnlyPolicy
与
PredicateAndTopkPolicy
如果您想了解更多信息,请查看下面列出的资源。
Highlights
以下是一些值得注意的事件,也许您可以找到感兴趣的内容。
- 在 Query 日志中增加 Spill 相关信息。
- 支持使用 COPY INTO 将数据导出为压缩文件。
- 引入 HTTP API 来查询后台任务。
GET /v1/background/:tenant/background_tasks
- 阅读 Example 4: Filtering Files with Pattern 以了解如何使用模式来过滤文件。
What's Up Next
我们始终对前沿技术和创新理念持开放态度,欢迎您加入社区,为 Databend 注入活力。
修复由 SQLsmith 检测出的问题
自上个月引入 SQLsmith 测试,累计检测出大约 40 个问题。Databend Labs 正在致力于修复这些问题来改善各种场景下的系统稳定性。
我们希望你也可以参与到这项工作中,其中可能会有一些涉及类型转换和特殊值处理的简单任务,可以参考之前的其他修复进行处理。
如果你对这个主题感兴趣,可以尝试解决其中的部分问题或者参与讨论和 PR review。或者,你可以点击 https://link.databend.com/i-m-feeling-lucky 来挑选一个随机问题,祝好运!
New Contributors
一起认识社区中的新伙伴,Databend 因你们而变得更加美好。
Changelog
前往查看 Databend 每日构建的变更日志,以了解开发的最新动态。
地址:https://github.com/databendlabs/databend/releases
订阅我们的新闻简报
及时了解功能发布、产品规划、支持服务和云服务的最新信息!