图片新闻   
2026年, 第2026卷, 第5期 刊出日期:2026-09-25 上一期   
全选选: 隐藏/显示图片
“数据科学与工程前沿”专辑编委会
2026 (5):  4-4. 
摘要 ( 0 )   PDF(75KB) ( 0 )  
参考文献 | 相关文章 | 计量指标
“数据科学与工程前沿”专辑导读
2026 (5):  5-6. 
摘要 ( 0 )   PDF(179KB) ( 0 )  
参考文献 | 相关文章 | 计量指标
数据系统与平台
当代数据库系统评测技术研究进展
耿航航, 黄煦华, 翁思扬, 杨洪宇, 张蓉
2026 (5):  13-25.  doi: 10.3969/j.issn.1000-5641.2026.05.002
摘要 ( 2 )   HTML ( 1 )   PDF(832KB) ( 0 )  

随着数据库系统持续向分布式、云原生、混合事务/分析处理、多模态数据管理和智能体访问场景演进, 数据库评测的对象、负载形态和质量指标均发生了显著变化. 传统评测方法主要面向关系型数据库中的固定查询、稳定负载和单一性能指标, 已难以充分刻画现代数据库系统在复杂功能、混合负载、异常环境、生态迁移和安全边界下的真实表现. 为此, 本文围绕现代数据库系统的关键质量属性, 构建了涵盖功能正确性、性能、可用性、兼容性和安全性的评测技术分类框架, 并系统梳理各类评测方法的研究进展、适用场景与局限性. 进一步地, 本文分析大语言模型和智能体驱动的新型数据库访问方式对评测体系提出的新挑战, 指出未来数据库评测需要从单点功能测试走向端到端质量验证, 从静态基准测试走向动态场景仿真, 并进一步覆盖多模查询、智能体接口、结构化结果返回和全链路安全验证等新兴对象. 本文旨在为现代数据库系统评测技术的体系化研究与工程实践提供参考.

数据和表 | 参考文献 | 相关文章 | 计量指标
可扩展区块链架构设计与展望
金澈清, 周倩, 张召, 杨艳琴
2026 (5):  26-41.  doi: 10.3969/j.issn.1000-5641.2026.05.003
摘要 ( 2 )   HTML ( 0 )   PDF(1644KB) ( 0 )  

区块链是构建以数据和数学为基础的信任基础设施的关键技术. 随着其在经济、民生等领域的应用不断深入, 用户规模急剧扩大, 任务逻辑日趋复杂, 如何提升区块链系统的可扩展能力已成为当务之急. 传统分布式数据库系统主要处理故障停止容错问题, 而区块链系统需要应对拜占庭容错问题, 这使得后者的执行性能远低于前者. 体系架构是制约区块链性能的关键因素, 通过体系架构创新来提升可扩展性尤为重要. 本文回顾了区块链体系架构演变对可扩展性的影响, 深入分析节点间的信任关系, 并设计了一种层级化链片混合架构——以层级化方式组织和管理分片, 有助于增强系统的可扩展能力. 展望未来, 还可从信任机制设计、模块化设计、软硬件协同、链上链下协同以及人工智能深度融合等方向, 持续推动区块链可扩展能力的进一步提升.

数据和表 | 参考文献 | 相关文章 | 计量指标
面向开放环境的分布式多智能体协作框架
张召, 李欣然
2026 (5):  42-50.  doi: 10.3969/j.issn.1000-5641.2026.05.004
摘要 ( 3 )   HTML ( 0 )   PDF(786KB) ( 0 )  

随着大语言模型赋予智能体更强的语义理解与任务执行能力, 多智能体系统正从封闭内网走向开放网络, 在跨机构金融审计、分布式科学计算、去中心化智能服务等场景中展现出广阔前景. 然而, 开放环境中参与者互不信任、利益多元、无中心权威, 导致现有系统的协作过程不可验证、故障难以复现与恢复、行为无法追责. 本文系统梳理了开放环境下多智能体协作面临的核心挑战, 包括状态转换的语义正确性与日志可验证性之间的内在冲突、长期记忆的可信存储与版本一致性问题, 以及自利智能体参与下的贡献归因与激励相容困境. 在此基础上, 提出以区块链与可验证计算为技术基底的理论框架, 包括链上链下协同的总体架构、可验证容错状态机、语义记忆的可验证存储与一致性维护、以及抗操纵的行为归因与激励相容机制. 本研究将推动分布式系统、形式化验证、博弈论与大语言模型不确定性的深度交叉, 为“人工智能+”行动提供可信任协同的基础理论支撑.

数据和表 | 参考文献 | 相关文章 | 计量指标
数据资源可信访问机制设计与场景分析
王虎, 章涵, 王天华, 赵春艳
2026 (5):  51-65.  doi: 10.3969/j.issn.1000-5641.2026.05.005
摘要 ( 2 )   HTML ( 0 )   PDF(923KB) ( 0 )  

跨机构数据API (Application Programming Interface) 调用常涉及个人信息、法人信息、电子证照及授权记录等敏感数据, 账号密钥、IP (Internet Protocol) 白名单和普通访问令牌通常侧重核验调用方身份, 难以证明单次调用已取得数据主体合法授权, 也难以约束关键业务参数并支撑全流程追溯. 针对主体授权难验证、请求参数不可信和访问过程难追溯等问题, 本文提出由可信访问代理 (Trusted Access Agent, TAA)、可信访问平台 (Trusted Access Platform, TAP) 和可信访问网关 (Trusted Access Gateway, TAG) 协同的数据资源可信访问机制. 该机制以ABAC (Attribute-Based Access Control)/XACML (eXtensible Access Control Markup Language) 的属性判定思想为基础, 将数据可信访问形式化为“主体–应用–终端–资源–用途–时效”的六元约束匹配问题, 并通过采用JWT (JSON Web Token) 等格式承载的可信访问令牌绑定授权证据与访问声明, 由资源侧TAG执行签名验证、时效校验、范围匹配、防重放保护和审计记录. 以电子证照社会化场景为例, 分析了组件映射、跨网络部署链路与典型异常情形. 方案设计表明, 该机制在架构上支持数据API调用中的主体授权绑定、请求一致性校验、最小权限控制和全流程追溯能力.

数据和表 | 参考文献 | 相关文章 | 计量指标
数据智能技术
大规模机器经验主义视角下的人工智能及应用展望
胡仁君
2026 (5):  66-76.  doi: 10.3969/j.issn.1000-5641.2026.05.006
摘要 ( 2 )   HTML ( 0 )   PDF(1523KB) ( 0 )  

以大模型为代表的人工智能 (AI), 其核心能力源于对大规模人类经验数据的统计建模, 可概括为一种机器经验主义. 在此视角下, AI呈锯齿状特征, 在不同维度上能力极不均匀. 由此引出3种AI应用路径: 协同, 通过互补方法弥补AI能力薄弱面; 原生, 借助感知、推理、规划、反思等涌现能力以智能体形式重构任务; 跨领域迁移, 将生成式建模从自然语言拓展到其他领域. 进一步讲, AI正以自然语言交互、开源模型及词元服务为基座, 大幅降低智能技术使用门槛, 推动技术平权. 最后讨论了该视角对人才培养的启示.

数据和表 | 参考文献 | 相关文章 | 计量指标
HGC-FKT: 异构反事实图增强的公平知识追踪模型
于洋, 王雅婷, 张天成, 于明鹤, 于戈
2026 (5):  77-94.  doi: 10.3969/j.issn.1000-5641.2026.05.007
摘要 ( 2 )   HTML ( 0 )   PDF(1125KB) ( 0 )  

为解决现有知识追踪模型存在的群体预测性能差异、数据稀疏性及遗忘规律建模不足3个核心问题, 提出了一种异构反事实图增强的公平知识追踪模型HGC-FKT (Heterogeneous Counterfactual Graph-Enhanced Fair Knowledge Tracing). 为缓解不同学生群体之间的预测性能差异, 本文设计了一种反事实启发的图增强机制. 该机制根据历史学习表现识别弱势学生群体, 并从其未作答问题中筛选高价值候选问题, 构造“若该学生与候选问题发生交互”的假设性学习情境; 进一步利用相似学习者的已观测行为对潜在作答结果进行经验估计, 据此扩充弱势学生的图连接, 并结合群体差异正则化降低不同学生群体之间的预测性能差距. 同时, 构建学生–问题图和问题–知识概念图的双图结构, 融合行为与结构信息, 并融入遗忘特征以优化建模. 在Assist09、Assist12、Junyi数据集上的实验表明, HGC-FKT在预测公平性上优于现有主流方法, 结合图结构建模与遗忘感知注意力机制, 模型提升了建模精度与认知贴合度; 在Assist09数据集上, 模型的AUC (Area Under the ROC Curve) 值达到0.8108.

数据和表 | 参考文献 | 相关文章 | 计量指标
基于大小模型协同优化的表格数据准备工作流生成方法
陈思蓓, 韩宵玥, 范举, 杜小勇
2026 (5):  95-108.  doi: 10.3969/j.issn.1000-5641.2026.05.008
摘要 ( 3 )   HTML ( 0 )   PDF(1938KB) ( 0 )  

随着大数据与人工智能的发展, 越来越多的行业用户开始借助机器学习进行数据分析. 本文聚焦于机器学习场景下的数据准备问题, 旨在针对给定的机器学习任务 (包括表格数据集、训练目标和模型配置), 自动构建高质量数据准备工作流. 现有工作通常基于深度神经网络模型, 这类方法需要预先定义一个有限的数据准备操作空间, 难以满足定制化需求. 随着大语言模型 (LLM) 的发展, 越来越多的研究开始探索利用 LLM 自动生成数据准备工作流, 但由于 LLM 难以理解表格数据的结构, 并且缺乏面向下游任务性能的目标优化, 限制了模型的最终表现. 为此, 本文提出了一种新颖的基于大小模型协同优化的表格数据准备工作流生成框架——LLMPipe. 该方法首先充分利用大语言模型在语义理解与知识泛化方面的优势, 结合任务描述与上下文信息, 生成具有针对性和领域适应性的定制化数据准备操作; 随后, 引入轻量级模型对操作特征进行建模, 并利用强化学习算法优化操作排序策略, 从而实现对数据准备流程的动态编排. 该框架通过“大模型扩充、小模型调优”的协同方式, 在保障领域知识理解能力与高质量工作流组合能力的同时, 提高了整体计算效率, 有效增强了生成工作流的定制性与合理性. 本文在 Kaggle 平台上的多个真实机器学习任务上开展了大量实验. 实验结果表明, 相较于现有方法, 本文提出的框架在机器学习任务上的准确性取得了显著提升, 达到了当前最优水平.

数据和表 | 参考文献 | 相关文章 | 计量指标
音频驱动的跨模态交互技术综述
唐明曙, 于明鹤, 张天成, 于戈
2026 (5):  109-118.  doi: 10.3969/j.issn.1000-5641.2026.05.009
摘要 ( 2 )   HTML ( 0 )   PDF(2703KB) ( 0 )  

多模态交互是人工智能领域的重要研究方向, 其中音频模态承载了丰富的时序动态信息和环境语义, 在智能助手、虚拟数字人和自动驾驶等场景中具有重要作用. 然而, 现有综述多以视觉模态为中心, 对以音频为核心的跨模态交互缺乏系统性梳理, 难以全面呈现该领域的技术脉络与发展瓶颈. 本文以音频为主导模态, 围绕音频与文本、静态图像、动态视频3类交互主线, 并延伸至音频驱动3D运动生成方向, 系统总结近年来的代表性方法、技术路线和应用进展. 在此基础上, 本文从数据基础、时序建模、评测体系和真实场景适应性等方面分析不同研究方向的发展现状与主要局限, 重点分析多模态音频数据集在规模、标注质量和获取成本方面面临的瓶颈. 总体来看, 音频跨模态交互已在统一表征学习、生成式建模和真实场景应用中取得显著进展, 并正在向更强的多粒度对齐能力、更高质量的数据支撑、更鲁棒的评测体系和更高效的部署方法持续发展.

数据和表 | 参考文献 | 相关文章 | 计量指标
大模型时代的数据可视化理解
王长波, 宋思程
2026 (5):  119-132.  doi: 10.3969/j.issn.1000-5641.2026.05.010
摘要 ( 2 )   HTML ( 0 )   PDF(1986KB) ( 0 )  

多模态大模型的发展推动可视化图表从静态信息载体转变为模型理解、推理、生成和安全评估的重要对象. 围绕大模型时代的可视化与可视分析研究, 本文系统梳理了可视化图表理解和误导性可视化分析两个方向的研究进展. 前者关注模型如何从位图、矢量图和 D3 图等不同输入形态中恢复图表结构、数据关系和视觉编码, 并进一步支持图表问答、视觉定位、风格化设计以及标题与描述文本生成; 后者关注图表在数据选择、视觉编码、文本解释和传播语境中可能造成的误导, 重点讨论误导性可视化的类型划分、视觉语言模型评估、自动检测、可解释分析、交互式纠正与安全防御. 现有研究表明, 图表理解和误导性可视化分析共同依赖数据、视觉、文本和语义之间的可靠对齐. 未来应进一步发展统一图表表征、细粒度证据定位、可信生成、人机协同纠错以及面向大模型安全的可视化防御机制.

数据和表 | 参考文献 | 相关文章 | 计量指标
钢铁物流语义感知与不确定性量化协同调度框架
赵乙茗, 刘昊阳, 董宜滔, 毛嘉莉, 李忠斌
2026 (5):  133-144.  doi: 10.3969/j.issn.1000-5641.2026.05.011
摘要 ( 2 )   HTML ( 0 )   PDF(2888KB) ( 0 )  

大宗工业物流中, 订单文本的隐性相容约束难以被准确识别, 导致语义置信度缺失; 拆分阶段忽略目的地空间分布, 引发跨区域绕行与尾单积聚. 针对上述问题, 提出面向钢铁物流的语义感知与不确定性量化协同调度框架, 将语义理解、不确定性量化与调度决策统一建模. 语义感知模块以领域微调 Sentence-BERT 提取文本表征, 融合潜在约束图与混合专家路由建模物料相容关系, 经大语言模型知识蒸馏引入工业拼载规则, 实现长尾非标订单零样本推断. 决策模块采用变分概率超网络, 通过变分推断同步输出权重均值与方差以显式量化认知不确定性, 抑制对少见物料的过度乐观估计; 依参数化马尔可夫决策过程联合优化离散路径与连续拆分比例, 可微分物理约束层强制输出满足载重硬约束. 基于170万条真实工业记录的实验表明, 约10万单规模下竞争比达0.8641, 长尾场景精确率为0.8942.

数据和表 | 参考文献 | 相关文章 | 计量指标
数据治理
开源AI治理与数据标准话语权: 困境、路径与学科视角
韩威如, 贺雯忆, 金逸胜, 王伟, 段莫名
2026 (5):  145-152.  doi: 10.3969/j.issn.1000-5641.2026.05.012
摘要 ( 2 )   HTML ( 0 )   PDF(2553KB) ( 0 )  

开源人工智能 (AI) 治理中的标准话语权失衡, 使中国开源模型的事实优势难以转化为制度话语权. 本文以标准话语权为分析对象, 考察其失衡的表现与成因: 开源促进会 (Open Source Initiative, OSI) 董事会无亚洲代表, 其开源AI定义 (Open Source AI Definition, OSAID) 因不要求公开训练数据而受到多方批评, 欧盟AI法案的开源豁免在高风险场景下亦不适用; 与此同时, 中国开源AI模型已形成事实标准, Qwen衍生模型超过11.3万个, DeepSeek在HuggingFace平台关注度居首, 而制度话语权与事实贡献之间仍存在明显落差. 本文分析标准竞争背后的权力逻辑, 梳理数据跨境治理的制度困境, 提出依托AI物料清单 (AI Bill of Materials, AIBOM) 标准化、可信数据空间建设和区域性合规互认等路径构建自主标准生态的方案, 并从数据学科建设的视角论述标准构建的知识基础和人才支撑.

数据和表 | 参考文献 | 相关文章 | 计量指标
扩散模型风险治理: 对齐、质量与真实性权衡视角
陈碟, 陈岑, 王延昊
2026 (5):  153-166.  doi: 10.3969/j.issn.1000-5641.2026.05.013
摘要 ( 2 )   HTML ( 0 )   PDF(2541KB) ( 0 )  

扩散模型的快速发展正在重塑图像与视频生成范式, 并推动生成式人工智能从研究工具逐渐演化为数字内容基础设施. 然而, 生成能力提升的同时, 也伴随着内容安全、版权归属、公平偏见、真实性缺失以及隐私泄露等一系列治理风险. 现有研究较少关注不同安全目标之间的内在冲突: 过强的安全对齐可能削弱生成质量, 真实性约束又可能限制模型创造能力, 而更高的视觉逼真度则进一步放大深度伪造与隐私风险. 围绕上述问题, 本文从内容安全、版权与知识产权、公平性与偏见、幻觉与真实性、隐私泄露5个维度, 对扩散模型中的核心治理风险进行系统梳理, 并提出“对齐、生成质量、真实性” (Alignment–Quality–Truthfulness, AQT) 三元权衡框架, 用于统一分析扩散模型中的关键矛盾与底层机制. 进一步指出, 数据记忆、概念耦合、指导放大、世界模型缺失以及数据分布偏差, 共同构成当前扩散模型治理问题的重要来源. 本文希望通过 AQT 框架为扩散模型安全研究提供统一分析视角, 并推动生成模型从“高质量生成”走向“安全、真实且可信的生成”.

数据和表 | 参考文献 | 相关文章 | 计量指标
面向 AI Agent 能力生态的开源协作治理: OpenClaw 案例研究
耿航航, 陈小伟, 韩凡宇, 王伟
2026 (5):  167-177.  doi: 10.3969/j.issn.1000-5641.2026.05.014
摘要 ( 2 )   HTML ( 0 )   PDF(1222KB) ( 0 )  

人工智能原生 (Artificial Intelligence-native, AI-native) 开源项目正从代码仓库演化为连接模型、工具、插件与用户场景的能力生态, 其早期的关注爆发是否能够转化为稳定的协作治理能力, 仍缺乏量化证据. 本文基于 OpenDigger 公开数据, 从项目影响力、参与规模、问题处理能力和贡献分布4个维度, 分析 OpenClaw 在 2025 年11月至2026年3月的早期协作动态, 并与 vLLM、Claude Code、Dify 3个同窗口 AI 原生项目进行对照. 结果表明, OpenClaw 的关注增长已经转化为实际协作扩张, 2026 年第一季度 OpenRank 与 activity 均高于3个对照项目; Issue 关闭率为 0.70, 是4个项目中的最低值, 问题处理能力未能跟上参与者和协作事件的增长; 组织层的活动高度集中在主仓库, 仓库内部则呈现长尾贡献分布. 较高的 bus factor 说明贡献参与面较广, 但其治理含义仍需结合核心维护者结构判断. 研究结果提示, AI 原生开源项目在扩大参与规模的同时, 还需要建设与之匹配的问题处理和贡献吸收机制.

数据和表 | 参考文献 | 相关文章 | 计量指标
数据智能应用
大语言模型与多智能体赋能新型电力系统
纪坤华, 金浩阳, 刘文辉, 黄定江
2026 (5):  178-195.  doi: 10.3969/j.issn.1000-5641.2026.05.015
摘要 ( 2 )   HTML ( 0 )   PDF(3242KB) ( 0 )  

在“双碳”目标和高比例新能源接入背景下, 新型电力系统面临不确定性、多主体协同、数据孤岛以及安全可信等挑战. 本文构建“基础模型与多模态表征—检索增强生成与知识图谱融合—多智能体协同与具身智能”三层技术框架, 并讨论世界模型对物理后果预演的作用. 围绕市场交易、调度运维、安全态势和储能用能四域, 归纳相关技术的适用任务、约束注入方式与工程边界. 综述表明, LLM宜作为与检索证据、物理求解器、数字孪生和人在回路机制协同的高能力助手与受约束执行组件, 而非无边界自治控制器. 未来重点在于建立可信证据、物理后果评估和责任边界协同闭环.

数据和表 | 参考文献 | 相关文章 | 计量指标
SQL4Domain: 面向电力垂类领域的高可靠Text-to-SQL生成与校验框架
张远来, 汪庆宁, 高明
2026 (5):  196-207.  doi: 10.3969/j.issn.1000-5641.2026.05.016
摘要 ( 2 )   HTML ( 0 )   PDF(946KB) ( 0 )  

近年来, 随着大语言模型 (Large Language Model, LLM) 的快速发展, Text-to-SQL任务取得了突破性进展. 然而, 在垂类领域 (如金融、医疗、电力等行业) 中, 由于文本问句表达复杂且数据库结构专业性强, Text-to-SQL任务仍然面临重大挑战. 本文提出了一种面向垂类领域的高可靠Text-to-SQL智能解析框架SQL4Domain, 以电力领域为典型应用案例. 该框架首先利用垂类领域知识库对用户问句进行意图识别和关键实体抽取, 随后结合领域知识提示进行SQL (Structured Query Language)生成, 最后通过多策略知识验证提升SQL的准确性和可靠性. 在电力领域数据集上的实验结果表明, SQL4Domain在执行准确率上显著优于现有方法, 相较于主流的DAIL方案整体性能提升了21.65%.

数据和表 | 参考文献 | 相关文章 | 计量指标
Palantir技术与商业范式解构及其中国本土化适配路径
周烜, 李晖, 钱卫宁, 周傲英
2026 (5):  208-223.  doi: 10.3969/j.issn.1000-5641.2026.05.017
摘要 ( 2 )   HTML ( 0 )   PDF(750KB) ( 0 )  

复杂组织的数字化转型与智能化决策闭环, 是信息系统与战略管理交叉领域的重大理论与实践命题. 针对软件企业在重人力定制服务中陷入规模经济不显著的“增长困境”, 本文基于软件经济学与知识治理视角, 针对决策智能领军企业 Palantir 这一案例, 系统解构了其“本体 (Ontology) ”驱动的技术架构与“前线部署工程师 (FDE) ”组织模式的协同演进机制. 研究发现: Palantir 通过“现场服务资产化与产品化”机制将高成本的定制服务转化为长周期的模块化隐性研发资产, 由此打破了传统重人力 IT 服务的收益递减瓶颈; 但该模式的规模化跃迁高度依赖于超级头部客户结构、复合型人才供给、高行政杠杆驱动的组织嵌入性以及主权级信任机制等严苛的边界条件. 立足中国工业数字化转型的现实情境, 针对数据质量异质性、多级治理摩擦及软件价值结构性低估等现实瓶颈, 本文提出了本土智能化决策系统的演进路径与策略建议.

数据和表 | 参考文献 | 相关文章 | 计量指标
语言教育科技问题、方法与实践
钱卫宁, 王春阳, 兰韵诗, 王伟, 蒲鹏, 周傲英
2026 (5):  224-236.  doi: 10.3969/j.issn.1000-5641.2026.05.018
摘要 ( 3 )   HTML ( 0 )   PDF(862KB) ( 0 )  

语言教育科技是智慧教育中最具代表性的重要组成部分之一. 面对当前新的学习环境和技术发展趋势, 协调和解决大规模教育与个性化学习、碎片化知识与系统性构建这两对智慧教育所面对的根本性矛盾, 在语言教育中尤为重要. 本文从语言学习的本质与当代人工智能的特征出发, 分析了现有在线教育模式与语言学习工具的局限, 提出以数据驱动的个性化学习服务化解第一对矛盾、以场景化学习与内容共享机制化解第二对矛盾的方法体系, 阐述以数据来驱动高质量学习服务的闭环机制, 并结合机器语言学习 (即程序设计) 和国际中文教育这两个具体场景, 介绍水杉在线和水杉中文两个在线学习平台的实践, 分析这一技术路线的可行性. 论文最后对语言教育科技的技术发展趋势和实践问题进行了简单的分析与展望.

数据和表 | 参考文献 | 相关文章 | 计量指标