news 2026/10/8 1:52:51

ChatGPT AutoExpert 之 Data Analysis GPT 系统提示词全解:数据分析智能体的角色设计与实战用法

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
ChatGPT AutoExpert 之 Data Analysis GPT 系统提示词全解:数据分析智能体的角色设计与实战用法
  • 提示工程
  • AI 应用
  • AI Agent

【免费下载链接】ChatGPT-AutoExpert

🚀🧠💬 Supercharged Custom Instructions for ChatGPT (non-coding) and ChatGPT Advanced Data Analysis (coding).

项目地址:https://gitcode.com/gh_mirrors/ch/ChatGPT-AutoExpert
点击查看免费下载

本篇技术指南以 ChatGPT AutoExpert 开源仓库(README.md)中提取的 Data Analysis 自定义 GPT 系统提示词为绝对核心,逐段拆解其角色定位、行为准则、Python 工具调用策略与隐私边界,并结合仓库内 Advanced Data Analysis 底层系统提示词、开发者版自定义指令等源码级资料进行纵深印证。读完本文,你将完整掌握该提示词的设计意图、每条指令的底层落地机制,以及如何在 ChatGPT 中复现并运行一个以 Python 为引擎、以统计分析与可视化为核心的 Data Analysis GPT。

一、Data Analysis GPT 在 AutoExpert 生态中的定位

ChatGPT AutoExpert 是一套旨在提升 GPT-4 / GPT-3.5 对话模型响应深度与准确度的自定义指令集合,其仓库结构将提示词按用途划分为多个目录:

  • standard-edition/:面向非编码类日常问答的"标准版"自定义指令;
  • developer-edition/:面向编码任务、需要 GPT-4 与Advanced Data Analysis的"开发者版";
  • _system-prompts/gpts/:从 ChatGPT 官方"Custom GPTs"中提取的系列系统提示词,其中就包括本文主角 data_analysis.md。

根据 Custom GPTs 总览 README 的登记表,官方商店中的 "Data Analysis" GPT 描述为"Drop in any files and I can help analyze and visualize your data"(拖入任意文件,即可帮你分析与可视化数据),其启用的工具仅为python——没有浏览器、没有 DALL·E。这决定了该 GPT 是一个"纯计算引擎"型智能体:一切能力都建立在代码执行之上。

值得注意的前提:官方 "Custom GPTs" 使用独立的gpt-4-gizmo模型,拥有独立的用量限制,且所有 Custom GPT 共享该限额,上下文大小为 32k(见 _system-prompts/gpts/README.md)。理解这一约束,有助于我们在设计分析任务时控制数据规模与上下文占用。

二、核心角色定义:数据集解释与分析助手

原提示词的第一段明确了该 GPT 的首要职能:

As a Data Analysis GPT, your primary function is to assist users in interpreting and analyzing complex data sets. You should respond to queries with clear, concise, and informative explanations.

可以提炼出四个关键词,它们构成了整个提示词的行为地基:

  1. Interpret(解释):不止于计算结果,还要把数据的业务含义讲清楚;
  2. Analyze(分析):主动执行统计检验、模式识别等分析动作;
  3. Clear & Concise(清晰简洁):回复要信息密度高、不绕弯,与 AutoExpert 一贯的"减少免责声明与废话"(Minimized Hand-Holding,见 README.md)理念一脉相承;
  4. Informative(有信息量):每条回复都要交付实质结论,而非空泛描述。

当用户以原始数据或描述性摘要(descriptive summary)两种形式提供数据时,该 GPT 都应启动自身能力:执行统计分析(statistical analyses)、生成可视化(visualizations)、给出洞见(insights)。同时,它被要求理解各种数据格式(various data formats)、识别显著模式(identify significant patterns),并基于实证证据给出结论(offer conclusions based on empirical evidence)——这是"数据驱动而非直觉驱动"的直接指令化表达。

从源码印证:数据格式能力的底层支撑

"理解各种数据格式"并非空话,其技术底座来自 ChatGPT 后端的工具链。在 _system-prompts/all_tools.md 中可以找到myfiles_browser工具:

  • search(query: str):对当前会话上传的文件执行检索并显示结果;
  • open_url(url: str):按文档 ID(通常为 UUID)打开文档;
  • click(id: str)、back()、scroll(amt: int)、quote_lines(start, end):定位、回溯、滚动与按行引用。

也就是说,用户上传的 CSV、Excel、JSON 等文件会先进入"文件浏览器"环节,GPT 通过检索与打开文档来完成格式识别与内容抽取,再交由 python 工具做真正的计算。建议在实际使用中,面对超大文件先让 GPT 用search定位关键列与抽样行,再决定是否全量读入,以规避 32k 上下文与 60 秒执行超时的双重限制。

三、响应准则:准确性优先与澄清机制

原提示词第二段写道:

In your responses, prioritize accuracy and relevance. When necessary, you may ask clarifying questions to ensure that your analyses meet the user's needs. You should maintain a professional tone and refrain from providing personal opinions or advice outside the scope of data analysis.

这里包含三条相互咬合的准则:

  • 准确性优先(prioritize accuracy):结论必须可复核、可溯源,杜绝臆测;
  • 澄清前置(clarifying questions):当分析目标模糊时,允许反问。例如"这份销售数据想比较的是月度同比还是环比?""异常值是否需要剔除,剔除标准是什么?"这类问题能显著提升后续分析的命中率;
  • 角色边界(scope discipline):保持专业语气,不越界提供个人意见。数据分析 GPT 只回答"数据怎么说",不代替用户做商业决策。

这一"必要时提问、但不过度打扰"的设计,与 AutoExpert 开发者版中"Unless you're only answering a quick question…"的响应节奏(见 developer-edition/chatgpt__custom_instructions.md)是同构的:提问是手段,交付高质量分析才是目的。

四、Python 工具策略:复杂任务的代码执行通道

原提示词第三段是该 GPT 的"能力开关":

For tasks that involve extensive data, such as creating visualizations or running complex statistical models, you should utilize the Python tool to execute code. Remember to present your findings in a way that is understandable to users regardless of their statistical background.

要点有三:

  1. 触发条件:涉及大量数据、需要绘图、或需要跑复杂统计模型时,必须调用 python 工具执行代码,而不是"口头描述"应该怎么做;
  2. 呈现方式:无论用户的统计学背景如何,都要把结果翻译成可理解的语言——代码是内部引擎,自然语言才是交付界面;
  3. 隐含边界:并非所有任务都要开 Jupyter,简单计算可以走推理完成,这与开发者版"Unless running a command, don't use Jupyter"(developer-edition/chatgpt__about_me.md)的分流策略一致。

4.1 python 工具的运行环境(源码实证)

该 GPT 使用的 python 工具,其底层环境在 _system-prompts/advanced-data-analysis.md 中有精确描述:

When you send a message containing Python code to python, it will be executed in a stateful Jupyter notebook environment. python will respond with the output of the execution or time out after 60.0 seconds. The drive at '/mnt/data' can be used to save and persist user files. Internet access for this session is disabled.

据此可确认以下运行事实(这些是 ChatGPT Advanced Data Analysis 沙箱的公开约束,写入系统提示词):

特性说明
执行环境有状态(stateful)Jupyter notebook,跨代码单元格保留变量
单次超时60.0 秒,超时返回超时提示
持久化存储/mnt/data目录可保存并跨会话持久化用户文件
网络访问禁用,禁止外部 web 请求与 API 调用(会失败)
Python 版本3.8,运行在 x86_64 架构 VM 上(见 developer-edition/README.md)

对分析任务的直接启示:

  • 分步执行:60 秒超时意味着大数据集应分块处理、分步建模,而非一次性跑完整个 pipeline;
  • 善用 /mnt/data:中间结果(清洗后的 DataFrame、生成的图表文件)先落盘,再在后续单元格读取,既能绕开上下文限制,也为跨轮次分析保留状态;
  • 离线分析:不要指望在分析过程中联网抓取外部数据,一切数据来源只能是用户上传的文件;
  • 版本兼容:代码应面向 Python 3.8 编写,注意pandas、matplotlib等库在该版本下的 API 兼容性。

4.2 数据分析的标准动作组合

结合原提示词与沙箱约束,一个规范的数据分析会话应包含以下动作序列:

  1. 文件接收与格式识别:用myfiles_browser的search/open_url打开上传文件,识别格式(CSV、Excel、JSON 等)与结构(列名、类型、缺失值);
  2. 探索性分析(EDA):在 python 中执行df.head()、df.describe()、df.info()等,生成描述性统计摘要;
  3. 统计建模:按需运行相关性分析、回归、假设检验等;
  4. 可视化:用matplotlib/seaborn绘图,并把图表保存到/mnt/data供用户下载查看;
  5. 结论呈现:用非技术语言总结发现、给出基于实证证据的结论,并说明数据局限。

五、隐私与伦理边界:个人数据的处理红线

原提示词第四段给出了数据安全守则:

You should not perform any actions that involve personal data unless explicitly provided by the user for analysis within the current session. Respect privacy and confidentiality at all times. If a task cannot be completed due to ethical concerns or data limitations, you must communicate this clearly to the user.

逐条拆解:

  • 会话内使用原则:个人数据仅限用户在当前会话内明确提供、用于当次分析的场景,不得挪作他用;
  • 全程保密:任何时候都要尊重隐私与机密性,不重复利用历史会话中的敏感数据;
  • 显式沟通:因伦理问题或数据条件不足(如样本量太小、字段缺失)而无法完成任务时,必须如实告知用户,而不是硬凑结论。

这条准则与 AutoExpert 项目"减少免责声明但保留必要边界"的取向一致:不滥用合规话术堆砌篇幅,但在真正的红线(个人数据)面前绝不含糊。

六、教育角色:授人以渔的分析教练

原提示词最后一段定义了 GPT 的长期价值:

Lastly, you are to assist users in learning more about data analysis by providing explanations of concepts and methods when asked. This educational role is crucial as it empowers users to better understand and engage with their own data analysis tasks in the future.

这意味着 Data Analysis GPT 的职责不仅是"替用户算",还要在用户询问时解释:

  • 概念层面:什么是 p 值、置信区间、中心极限定理;
  • 方法层面:为什么选线性回归而不是决策树、缺失值填充有哪些策略及各自适用场景;
  • 实践层面:教会用户读懂自己得到的图表与统计输出。

这种"解释 + 交付"的双通道设计,与仓库中开发者版的 Preamble/Epilogue 机制(每次响应开头声明语言、专家角色、需求与计划,结尾总结 History / Source Tree / Next Task,见 developer-edition/README.md)异曲同工:都是在提升单次回答质量之外,帮助用户建立对分析过程本身的掌控感。

七、实战配置:如何将本提示词部署为可用的 Data Analysis GPT

原文档本质上是可直接粘贴的系统提示词,配合 ChatGPT 的 Custom GPTs 功能即可落地。部署步骤如下:

  1. 进入 GPT Builder:在 ChatGPT 界面选择"Explore GPTs"→"Create",进入自定义 GPT 编辑页;
  2. 粘贴指令:将 _system-prompts/gpts/data_analysis.md 的完整文本粘贴到 Instructions(行为上下文)区域;
  3. 开启工具:在 Capabilities 中启用Code Interpreter / Advanced Data Analysis(对应仓库中的 python 工具),无需开启 Browsing 与 DALL·E;
  4. 配置交互信息:按 _system-prompts/gpts/README.md 中官方 Data Analysis GPT 的样子,设置名称"Data Analysis"、简介"Drop in any files and I can help analyze and visualize your data",并填写 welcome message 与几个起始提问(prompt starters),例如:
    • "帮我分析这份销售数据的月度趋势"
    • "这个 CSV 里哪些特征与目标变量相关性最强?"
    • "为这份数据生成直方图与箱线图"
    • "解释一下这份回归结果中每个系数的含义"

7.1 进阶:与开发者版 verbosity 机制的配合

若你同时使用 AutoExpert 开发者版(developer-edition/),可让数据分析代码的详细度完全可控:开发者版支持V=[0-3]前缀调节代码风格(V=0 极简 code golf,V=2 简单为默认,V=3 冗长且注重 DRY,见 developer-edition/README.md)。典型用法:

  • V=1:用 pandas 读取这个 Excel,统计每列缺失率—— 得到精简、无冗余的高效代码;
  • V=3:对数据进行完整的探索性分析并可视化—— 得到模块化、带注释的完整 pipeline。

7.2 版本选择提醒

如果你需要的是"聊天 + 编码一体"的增强体验,仓库还提供两条路径:

  • 标准版(standard-edition/):面向非编码任务,含自动改写问题、斜杠命令、框架自动选择等能力;
  • 开发者版(developer-edition/):需 ChatGPT Pro 订阅(GPT-4 + Advanced Data Analysis),附带 autodev.py 配套脚本,支持/memory会话记忆打包、自定义 wheel 安装、文件/符号树维护等。

本文所讲的 Data Analysis GPT 提示词则是"开箱即用、专注分析"的轻量方案,适合不想引入完整开发者版、只需一个专职数据分析助手的场景。

八、小结:九行提示词背后的设计哲学

回看 _system-prompts/gpts/data_analysis.md 全文——它仅九行英文,却完成了五层行为设计:

层级原文要点落地机制
角色解释与分析复杂数据集清晰、简洁、有信息量的回复格式
能力统计分析、可视化、洞见调用 python 工具,Jupyter 沙箱执行
质量控制准确性优先、必要时澄清反问前置、专业语气、边界内不越权
合规个人数据会话内使用、隐私保密伦理/数据不足时显式沟通
增值教育角色应询解释概念与方法

这五层设计彼此咬合:角色定义能力范围,能力由工具承载,工具受环境约束(60 秒超时、无网络、/mnt/data 持久化),约束倒逼出分步执行与落盘策略,而教育角色则让每一次分析都沉淀为用户的可迁移技能。对于任何想打造"数据分析型智能体"的开发者或提示词工程师,这份提示词都是一份结构精炼、可直接复用的范本。


延伸阅读(仓库内):

  • Data Analysis GPT 原始系统提示词
  • Custom GPTs 总览与工具配置表
  • Advanced Data Analysis 底层系统提示词(python 工具环境约束)
  • 全量工具说明(含 myfiles_browser 文件浏览机制)
  • 开发者版使用手册(verbosity、斜杠命令、安装流程)
  • 开发者版自定义指令全文(Preamble / Epilogue 模板)
  • 开发者版 about_me(wheels 安装与 Jupyter 使用策略)
  • 标准版自定义指令(V=1~5 详细度分级参考)
  • 提示工程
  • AI 应用
  • AI Agent

【免费下载链接】ChatGPT-AutoExpert

🚀🧠💬 Supercharged Custom Instructions for ChatGPT (non-coding) and ChatGPT Advanced Data Analysis (coding).

项目地址:https://gitcode.com/gh_mirrors/ch/ChatGPT-AutoExpert
点击查看免费下载
上一篇:psutil 文档站构建工程指南:基于 Sphinx、ablog 与 GitHub Pages 的自托管文档体系
下一篇:OpenEuler Sw Committee工作流程详解:从议题提出到决策执行

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/8 1:51:21

NVIDIA T3 GPU大模型推理部署实战:TensorRT-LLM与FP8量化优化全记录

做AI推理部署这些年,最烦的一件事就是“模型能跑”和“模型能跑得快”完全两码事。尤其是当你手里拿到一张新卡,想让它把算力吃满,而不是在那儿闲等,这个过程踩坑能踩到怀疑人生。最近我一直在折腾的一个项目,代号就叫…

作者头像 李华
网站建设 2026/10/8 1:50:14

K8S微服务部署方案:从原理到实践,避开常见坑

简介:这份文档面向正在推进微服务架构落地的架构师、运维工程师与技术决策者,围绕K8S容器云平台给出可参考的部署方案,帮助解决服务依赖、服务发现、负载均衡、集群管理与有状态数据管理等微服务化过程中的典型难题。资源包内仅含1个docx文档…

作者头像 李华
网站建设 2026/10/8 1:45:45

用 wazero CLI 运行 WebAssembly 命令行应用:examples/cli 示例全解析

开发工具系统底层 【免费下载链接】wazero wazero: the zero dependency WebAssembly runtime for Go developers 项目地址: https://gitcode.com/gh_mirrors/wa/wazero 点击查看 免费下载 本篇技术指南以 wazero 仓库中的 examples/cli 示例为骨架,讲解…

作者头像 李华
网站建设 2026/10/8 1:45:07

操作系统实验答案与报告全攻略:从环境搭建到自动化生成

简介:这份资源是北京交通大学操作系统课程的实验答案与报告合集,面向正在修读操作系统实验课、需要参考实现思路与报告写法的本科生,也可供自学者对照练习。压缩包共41个文件,约73KB,以26个C语言源文件为主&#xff0c…

作者头像 李华