2026年7月11日
Daft:面向多模态 AI 数据处理的 Python 数据引擎
如果你的 AI 项目已经不只是处理表格,而是同时要处理图片、音频、视频、Embedding 和结构化数据,传统 DataFrame 或 Spark 工作流很容易变得笨重。Daft 是一个开源的高性能数据引擎,定位就是服务 AI 和多模态工作负载:用 Python 写数据处理逻辑,
如果你的 AI 项目已经不只是处理表格,而是同时要处理图片、音频、视频、Embedding 和结构化数据,传统 DataFrame 或 Spark 工作流很容易变得笨重。Daft 是一个开源的高性能数据引擎,定位就是服务 AI 和多模态工作负载:用 Python 写数据处理逻辑,底层由 Rust 提供执行能力,并支持从本地任务扩展到 Ray、Kubernetes 等分布式环境。
它今天值得关注,不是因为“又一个数据框架”,而是因为 AI 应用的数据层正在变复杂:模型调用、向量生成、文件解析、批量推理、数据清洗往往混在一起。Daft 试图把这些步骤放进同一个可编排的数据处理框架里。
📌 这个项目是干什么的
- 统一处理多模态数据:官方 README 明确提到可处理图片、音频、视频、Embedding 与结构化数据,适合 AI 数据准备、批处理和分析场景。
- 内置 AI 操作:支持在数据管道里运行 LLM Prompt、生成 Embedding、做分类等操作,可接入 OpenAI、Transformers 或自定义模型。
- Python 原生体验:对开发者来说,上手方式更接近 Python 数据工程,而不是先搭一整套 JVM/Spark 环境。
- 可从本地扩展到分布式:官方文档提供本地使用、Ray 分布式运行等路径,适合先小规模验证,再扩到更大的数据处理任务。
🔍 为什么值得关注
第一,它抓住了 AI 工程里一个很真实的痛点:数据不再只是 CSV。很多团队做 RAG、视觉检索、内容审核、视频理解时,前处理和批量推理的复杂度并不低。Daft 把多模态数据、模型调用和数据管道放在一起,能减少“脚本胶水层”。
第二,它的定位比通用数据分析工具更贴近 AI 工作流。官方介绍中强调 AI and multimodal workloads,README 也给出了 Prompt、Embedding、分类这类操作方向。对需要批量处理非结构化数据的开发者,比单纯用 pandas 拼脚本更有工程化空间。
第三,项目维护状态较活跃。GitHub 仓库显示 Apache-2.0 许可证,近期持续提交,并在 2026-07-10 发布 v0.7.19。对开源工具来说,这至少说明它不是无人维护的展示项目。
🧪 谁适合试,怎么开始
如果你在做以下事情,可以优先看 Daft:
- 批量清洗图片、音频、视频或文档数据;
- 为 RAG / 多模态检索生成 Embedding;
- 在数据管道里批量调用模型做分类、抽取、打标签;
- 想用 Python 写逻辑,但未来可能需要分布式扩展。
最短尝试路径是:先看官方 Quickstart,跑通本地 DataFrame 示例;再看 Installation 文档确认环境;如果数据量变大,再研究 Ray 分布式运行方式。不要一开始就上集群,先用一个小样本验证它是否能减少你的数据处理脚本复杂度。
⚠️ 使用提醒
Daft 更适合“AI 数据工程”和“多模态批处理”,不等同于完整的 RAG 平台、Agent 框架或模型服务平台。它解决的是数据处理层问题,不会替你完成业务编排、权限管理、线上监控等生产系统能力。
另外,项目仍处在 0.x 版本阶段。引入生产链路前,建议重点验证三件事:现有数据源是否支持、团队是否接受新的 DataFrame API、分布式执行在你的数据规模下是否稳定。把它当作一个值得试验的数据引擎,而不是立即替换所有存量数据栈,会更稳妥。