华东师范大学学报(自然科学版) ›› 2026, Vol. 2026 ›› Issue (5): 95-108.doi: 10.3969/j.issn.1000-5641.2026.05.008
陈思蓓1,2(
), 韩宵玥2, 范举2,3,*(
), 杜小勇2,3
Sibei CHEN1,2(
), Xiaoyue HAN2, Ju FAN2,3,*(
), Xiaoyong DU2,3
摘要:
随着大数据与人工智能的发展, 越来越多的行业用户开始借助机器学习进行数据分析. 本文聚焦于机器学习场景下的数据准备问题, 旨在针对给定的机器学习任务 (包括表格数据集、训练目标和模型配置), 自动构建高质量数据准备工作流. 现有工作通常基于深度神经网络模型, 这类方法需要预先定义一个有限的数据准备操作空间, 难以满足定制化需求. 随着大语言模型 (LLM) 的发展, 越来越多的研究开始探索利用 LLM 自动生成数据准备工作流, 但由于 LLM 难以理解表格数据的结构, 并且缺乏面向下游任务性能的目标优化, 限制了模型的最终表现. 为此, 本文提出了一种新颖的基于大小模型协同优化的表格数据准备工作流生成框架——LLMPipe. 该方法首先充分利用大语言模型在语义理解与知识泛化方面的优势, 结合任务描述与上下文信息, 生成具有针对性和领域适应性的定制化数据准备操作; 随后, 引入轻量级模型对操作特征进行建模, 并利用强化学习算法优化操作排序策略, 从而实现对数据准备流程的动态编排. 该框架通过“大模型扩充、小模型调优”的协同方式, 在保障领域知识理解能力与高质量工作流组合能力的同时, 提高了整体计算效率, 有效增强了生成工作流的定制性与合理性. 本文在 Kaggle 平台上的多个真实机器学习任务上开展了大量实验. 实验结果表明, 相较于现有方法, 本文提出的框架在机器学习任务上的准确性取得了显著提升, 达到了当前最优水平.
中图分类号: