训练数据也能搭流水线:DataFlow 把清洗、去重和合成放进可视化工作台
WAIC 2026 展商元枢智汇的开源 DataFlow,用算子和流水线组织大模型数据的清洗、去重、评估与合成。项目今年加入 WebUI 和 DataFlow-Skills,让开发者可以拖拽搭流程,也能复用现成的数据处理步骤。
模型回答变差,不一定是模型不够大,也可能是喂进去的数据重复、过期或者格式混乱。过去,这些清洗工作常散落在脚本、表格和临时文件里,很难知道一条数据经历了哪些修改。
进入 WAIC 2026 企业目录的元枢智汇,正在把 DataFlow 做成一套可组合的数据准备工具:清洗、去重、评估、合成和抽取都变成可以连接的步骤。
它处理的是模型开工前最琐碎的一段
DataFlow 面向大模型训练、微调和知识库准备数据。开发者可以把文档解析、质量评估、去重、内容生成和格式转换组成流水线,让同一套规则反复运行。
今年上线的 WebUI 提供可视化流程搭建,DataFlow-Skills 则整理了算子开发、流水线组合和常见任务教程。不会一开始就写完整数据工程代码的团队,也能先从现成步骤改起。
项目基于 Python 和 Git 组织算子与配置,处理过程可以版本化。与把文件交给一个黑盒工具相比,团队更容易追踪某项规则何时变化,以及哪批数据需要重新生成。
可视化并不会替团队决定什么是“好数据”
同一句重复内容该不该删除,取决于任务。客服知识库希望减少冗余,语言模型训练却可能需要保留不同语境;医学、金融等场景还要额外处理授权、脱敏和质量责任。
DataFlow 提供的是编排和执行能力,评估标准仍要由业务与数据负责人确定。自动合成的数据也需要抽样检查,否则模型可能学到统一但错误的表达。
元枢智汇官网还提供企业数据平台和知识智能体方案,其中的效果数字来自公司案例页面。开源 DataFlow 是否适合某个团队,应以自己的数据规模、算力和流程测试为准。
先把一份杂乱文档做成可重复流程
普通开发团队可以先选择一小批 PDF 或网页:解析正文、去掉重复段落、打质量分,再输出知识库需要的格式。跑完后手工抽查失败样本,而不是直接处理全部历史文件。
评估重点不只是速度,还包括每一步能否复现、失败是否可定位、规则修改后能否只重跑受影响的部分。数据流水线一旦无法解释,后面的模型结果同样难以追责。
DataFlow 已经开放仓库、论文和产品入口。接下来值得观察的是 WebUI 的协作权限、更多行业算子和大规模任务的资源调度,这些会决定它能否从开发者工具进入企业日常数据生产。
想继续了解
• 元枢智汇官网
• DataFlow GitHub 仓库
• DataFlow 论文
• 上海交大工研院:元枢智汇与 DataFlow
• WAIC 2026 官方企业目录
一起维护这篇内容
我要更新 发现链接失效、信息过时或内容有误,可以提交更新建议。


交流讨论
最新评论