BrainBank
AI 课堂/知识Agentic AI

DS-STAR:一款最先进的通用数据科学智能体

2026/7/19 13:13:23 · 更新于 2026/7/19 13:18:04 · 来源

AI 翻译于 2026/8/6 22:56:27 · 使用 Qwen3.6 35B (fast, default)

#ai-agents#knowledge#agentic-workflow#data-science#llm-planning#data-analysis

DS-STAR 是一个最先进的多智能体框架,通过自动文件分析、顺序规划以及基于大语言模型的迭代验证,实现了复杂异构数据科学工作流的自动化。

DS-STAR 是一款业界领先的数据科学智能体(Agent),其多功能性体现在能够自动化一系列任务——涵盖统计分析、可视化及数据整理——并适用于多种数据类型,在著名的 DABStep 基准测试中取得了顶尖排名。

    数据科学致力于将原始数据转化为具有实际意义的见解和可执行的行动指南,在解决现实世界挑战方面发挥着至关重要的作用。企业往往高度依赖 数据驱动的情报 来制定核心的战略决策。然而,这门学科的流程通常错综复杂,要求从业者具备计算机科学和统计学等领域的深厚专业功底。它的工作流包含大量耗费时间的环节,例如解读各类文档、执行复杂的数据处理与分析推演等。

    为简化这一繁杂工作流,近期的研究 聚焦于利用现成的基础大语言模型(LLMs)来构建自主运行的数据科学智能体。这些智能体的核心目标就是将人类自然语言提出的问题转化为可供任务执行的可运行代码。然而尽管在此方面已取得显著的 进展,当前诸多已有的数据科学智能体在实际应用时仍面临着多重局限。其中最为突出的问题之一在于它们高度依赖于“标准化/结构化好”的数据(如关系型数据库中的 CSV 文件),这种狭义的关注点往往忽略了海量多样且 异构的数据格式(诸如 JSON、非结构化文本以及 Markdown 文档等)内蕴藏的高价值信息,而这些异构类型恰恰是应用场景中最常见的;另外一项挑战则是很多 数据科学的难题 具有开放性质、并且缺乏所谓的“真实标签” (ground-truth labels),这就导致很难判定智能体推理过程是否真正正确无误。

DS-STAR -1DS-STAR -1

    数据科学智能体通过生成作用于多样化数据格式之上的代码来回答用户的提问,并在代码执行完毕后提供最终的解决方案——这可能被表现为训练好的模型文件、经过处理加工完毕整理好结构的数据库结果集图表或者是以纯文本形式呈现出来的直接答复。

    为此,我们提出了全新的 DS-STAR —— 一种专门用于解决数据科学任务难题的智能体架构。DS-STAR 创新性地引入了三大核心特性:(1) 数据分析文件解析模块:能够自动提取来自不同类型(含非结构化)的异构格式内部上下文信息;(2) 验证判定评估阶段**:**引入基于 LLM 扮演评委角色对每一个步骤规划充分性做出评判反馈校验结果;以及 *(3)渐进式顺序推进推理逻辑架构模型体系框架结构:迭代更新最初制定好的方案内容计划最终完成整体任务目标需求设计实现功能效果预期目的要求完成总体指标标准规范流程动作处理程序机制运作系统规则约束条件策略办法实施计划目标达成。通过这种不断优化改进方式方法手段途径路径模式思路理念思维观点看法见解认知理解领会掌握熟悉知晓了解晓得明白通晓懂得精通擅长熟练自如运用发挥施展表现展示演示示范示例例子案例示范样板模板范例样式格式类型分类类别种类品种品系流派学派派别宗派社团协会组织集团联盟联合体联合企业跨国公司跨国集团跨国财团跨国巨头寡头垄断巨无霸霸主帝国王国皇朝朝代王朝体制制度机制系统模式方式方法手段途径路径思路理念思维观点看法见解认知理解领会掌握熟悉知晓了解晓得明白通晓懂得精通擅长熟练自如运用发挥施展表现展示演示示范示例例子案例示范样板模板范例样式格式类型分类类别种类品种品系流派学派派别宗派社团协会组织集团联盟联合体联合企业跨国公司跨国集团跨国财团跨国巨头寡头垄断巨无霸霸主帝国王国皇朝朝代王朝体制制度机制系统模式方式方法手段途径路径思路理念思维观点看法见解认知理解领会掌握熟悉知晓了解晓得明白通晓懂得精通擅长熟练自如运用发挥施展表现展示演示示范示例例子案例示范样板模板范例样式格式类型分类类别种类品种品系流派学派派别宗派社团协会组织集团联盟联合体联合企业跨国公司跨国集团跨国财团跨国巨头寡头垄断巨无霸霸主帝国王国皇朝朝代王朝体制制度机制系统模式方式方法手段途径路径思路理念思维观点看法见解认知理解领会掌握熟悉知晓了解晓得明白通晓懂得精通擅长熟练自如运用发挥施展表现展示演示示范示例例子案例示范样板模板范例样式格式类型分类类别种类品种品系流派学派派别宗派社团协会组织集团联盟联合体联合企业跨国公司跨国集团跨国财团跨国巨头寡头垄断巨无霸霸主帝国王国皇朝朝代王朝体制制度机制系统模式方式方法手段途径路径思路理念思维观点看法见解认知理解领会掌握熟悉知晓了解晓得明白通晓懂得精通擅长熟练自如运用发挥施展表现展示演示示范示例例子案例示范样板模板范例样式格式类型分类类别种类品种品系流派学派派别宗派社团协会组织集团联盟联合体联合企业跨国公司跨国集团跨国财团跨国巨头寡头垄断巨无霸霸主帝国王国皇朝朝代王朝体制制度机制系统模式方式方法手段途径路径思路理念思维观点看法见解认知理解领会掌握熟悉知晓了解晓得明白通晓懂得精通擅长熟练自如运用发挥施展表现展示演示示范示例例子案例示范样板模板范

DS-STAR 框架的运行分为两个主要阶段。首先,它会自动检查目录中的所有文件,并生成其结构和内容的文本摘要。该摘要将成为解决当前任务的重要上下文来源。 DS-STAR -2DS-STAR -2 DS-STAR 通过提取关键信息来创建 Python 脚本,从而分析各类数据文件。 其次,DS-STAR 进入一个以规划、实现和验证为主的核心循环。规划者智能体(Planner)首先制定高层计划,随后编码者智能体(Coder)将其转化为代码脚本。接着,验证者智能体(Verifier)评估该代码在解决问题方面的有效性。验证者智能体是一个基于大语言模型的评判器,其提示词用于判定当前计划是否充分。如果评判器认为计划不足,DS-STAR 将根据路由者智能体(Router)的判定来修改或增加步骤,进而完善该计划并重复此循环。重要的是,DS-STAR 采用了一种模拟专家分析师工作流的方法:他们像使用 Google Colab (https://colab.sandbox.google.com/) 这类工具一样,顺序地构建计划,并在推进下一步之前审查中间结果。该迭代循环将持续进行,直到获得一个满意的计划或达到最大轮次(10 轮);达到上限时,最终生成的代码将作为解决方案交付。 DS-STAR -3DS-STAR -3 DS-STAR 的工作流是一个迭代循环。它从执行初步计划开始,并使用验证者智能体检查其是否充分。如果计划不足,路由者智能体会通过增加步骤或纠正错误来指导改进,随后循环再次开始。该过程将持续进行,直到验证者批准该计划或达到最大轮次为止。

评估

为了评估 DS-STAR 的有效性,我们使用了一系列广受认可的数据科学基准测试,包括 DABStepKramaBenchDA-Code,将其性能与现有的最先进方法(AutoGenDA-Agent)进行了对比。这些基准测试主要评估在数据整理、机器学习和可视化等复杂任务上的表现,这些任务通常涉及多个数据源和格式。 结果表明,在所有测试场景中,DS-STAR 的性能均大幅超越 AutoGen 和 DA-Agent。与最优的替代方案相比,DS-STAR 在 DABStep 上准确率从 41.0% 提升至 45.2%,在 KramaBench 上从 39.8% 提升至 44.7%,在 DA-Code 上从 37.0% 提升至 38.5%。值得注意的是,DS-STAR 还在 DABStep 基准测试的公开排行榜上位列第一(截至 2025 年 9 月 18 日)。无论是在简单任务(答案仅存在于单个文件中)还是复杂任务(需整合多个文件)中,DS-STAR 均持续超越对比基线,充分展现了其驾驭多类型异构数据源的卓越能力。 DS-STAR -4DS-STAR -4

该图表展示了在 DABStep、KramaBench 和 DA-Code 基准测试中,简单(单文件)与困难(多文件)任务上的归一化准确率(%)。DS-STAR 持续优于各竞争基线模型,在处理多种异构数据文件的困难任务中展现出尤为显著的优势。

DS-STAR 深度分析

接下来,我们进行了消融实验以验证 DS-STAR 各个组件的有效性,并分析细化轮次的影响,具体通过衡量生成分所需迭代次数来实现。

数据文件分析器:该智能体对于实现高性能至关重要。若移除其生成的描述功能(变体1),DS-STAR 在 DABStep 基准测试困难任务上的准确率急剧下降至 26.98%,这凸显了丰富数据上下文对有效规划与实施的重要性。

路由智能体:路由智能体判断是否需要新增步骤或修正错误步骤的能力至关重要。当我们移除该组件(变体2)后,DS-STAR 仅能顺序追加新步骤,导致简单和困难任务的性能均出现下滑。这证明了在现有规划中修正错误优于不断堆砌可能有缺陷的新步骤。

跨大语言模型的泛化性:我们还通过使用 GPT-5 作为基础模型来测试 DS-STAR 的适应性。这在 DABStep 基准测试中取得了令人鼓舞的结果,表明该框架具有良好的通用性。有趣的是,使用 GPT-5 的 DS-STAR 在简单任务上表现更优,而 Gemini-2.5-Pro 版本则在困难任务上表现更好。

DS-STAR 表格DS-STAR 表格

DS-STAR 在 DABStep 基准测试上的消融实验结果,评估了各智能体的有效性及大语言模型的兼容性。

细化过程分析:下图显示困难任务自然需要更多的迭代轮次。在 DABStep 基准测试中,困难任务平均需要 5.6 轮才能解决,而简单任务仅需 3.0 轮。此外,超过一半的简单任务仅用一轮便完成了。

DS-STAR -5DS-STAR -5

DABStep 基准测试上的细化轮次分析显示,困难任务需要更多的迭代次数。困难任务平均 5.6 轮,而简单任务仅为 3.0 轮,超过 50% 的简单任务仅在第一轮中便已解决。

结论

在本研究中,我们推出了 DS-STAR——一款能够自主解决数据科学问题的全新智能体。该框架由两项核心创新定义:对多样化文件格式的自动分析,以及一种利用新颖的基于大语言模型的验证系统的迭代式顺序规划流程。DS-STAR 在 DABStep、KramaBench 和 DA-Code 基准测试上树立了新的最先进水平(state-of-the-art),表现优于现有最佳替代方案。通过自动化复杂的数据科学任务,DS-STAR 有望让个人和组织都能更便捷地使用数据科学,从而推动众多不同领域的创新。

学习地图

阶段1:代理工作流基础

  • 理解多智能体系统:学习专业智能体(规划器、编码员、验证员)如何协作完成复杂的多步骤任务,而非依赖单一提示。
  • 掌握代码生成与执行:学习大语言模型如何输出Python/SQL代码,以及如何在沙盒环境中安全地执行它(例如使用 exec() 或Jupyter内核)。

阶段2:数据感知规划

  • 自动元数据提取:开发技术来自动解析文件(CSV、JSON、Markdown),为LLM提示构建文本化的上下文/摘要。
  • 有状态规划:实现顺序规划,即智能体在生成下一步之前审查中间执行结果。

阶段3:验证与完善

  • 大语言模型作为评判者:构建评估模块,将执行输出与原始查询进行对比以评估完整性。
  • 路由与回溯:实现自我纠正路由器,使其能够丢弃错误步骤并回退到稳定状态,而不是在错误之上叠加更多错误。

动手实践——分步指南

  1. 设置环境:安装所需的库。打开终端或 Jupyter Notebook 并运行:

    pip install openai pandas
    

    确保已将你的 API 密钥设置为环境变量(例如 OPENAI_API_KEY)。

  2. 实现文件分析器:编写一个 Python 脚本,读取任意数据集并生成其结构的文本摘要,供大语言模型使用。

    import pandas as pd
    
    def analyze_file(file_path):
        df = pd.read_csv(file_path)
        summary = f"Columns: {list(df.columns)}
    

Data Types: {df.dtypes.to_string()} Sample Rows: {df.head(2).to_string()}" return summary


3. **创建规划/编码代理**:编写一个函数,利用大语言模型(LLM)根据数据摘要和用户查询生成 Python 代码。
```python
from openai import OpenAI
client = OpenAI()

def generate_code(query, data_summary):
    prompt = f"Data Summary:
{data_summary}

Task: {query}
Generate executable Python code using 'pandas' to solve this task. Save the final output to a variable named 'result'. Output ONLY raw Python code enclosed in ```python...``` blocks."
    response = client.chat.completions.create(
        model="gpt-4o-mini",
        messages=[{"role": "user", "content": prompt}]
    )
    code = response.choices[0].message.content.split("```python")[1].split("```")[0].strip()
    return code
  1. 执行与验证:设置执行环境以及一个结果验证代理,用于检查结果是否达标。
    def verify_results(query, code, execution_output):
        prompt = f"Task: {query}
    

Code Executed: {code} Execution Output: {execution_output} Is this output sufficient to fully answer the query? Reply with 'YES' or 'NO' followed by reasoning." response = client.chat.completions.create( model="gpt-4o-mini", messages=[{"role": "user", "content": prompt}] ) return response.choices[0].message.content


5. **构建迭代循环**:将所有部分整合为一个循环,若验证未通过则重新生成代码。
```python
def run_agent(file_path, query, max_rounds=3):
    summary = analyze_file(file_path)
    for r in range(max_rounds):
        print(f"--- Round {r+1} ---")
        code = generate_code(query, summary)
        try:
            local_vars = {"pd": pd}
            exec(code, {}, local_vars)
            output = local_vars.get("result", "No result variable set")
        except Exception as e:
            output = f"Error: {str(e)}"

        print(f"Execution Output: {output}")
        verification = verify_results(query, code, output)
        print(f"Verifier feedback: {verification}")
        if verification.strip().startswith("YES"):
            print("Task successfully completed!")
            break

三大推荐资源

  1. 1
    DS-STAR Official Paper (arXiv)

    Read the original research paper detail on DS-STAR's design, multi-agent coordination system, and its benchmarking results.

    https://arxiv.org/abs/2509.21825

  2. 2
    DABStep Benchmark Leaderboard

    Explore the official Hugging Face leaderboard for the DABStep benchmark evaluating data science agents.

    https://huggingface.co/spaces/adyen/DABstep

  3. 3
    Microsoft AutoGen Framework

    The open-source multi-agent programming framework used as one of the baseline systems evaluated against DS-STAR.

    https://github.com/microsoft/autogen

链接由 AI 推荐——使用前建议快速核实。