- 提示工程
- AI 应用
- AI Agent
【免费下载链接】ChatGPT-AutoExpert
🚀🧠💬 Supercharged Custom Instructions for ChatGPT (non-coding) and ChatGPT Advanced Data Analysis (coding).
本篇技术指南以 ChatGPT AutoExpert 开源仓库(README.md)中提取的 Data Analysis 自定义 GPT 系统提示词为绝对核心,逐段拆解其角色定位、行为准则、Python 工具调用策略与隐私边界,并结合仓库内 Advanced Data Analysis 底层系统提示词、开发者版自定义指令等源码级资料进行纵深印证。读完本文,你将完整掌握该提示词的设计意图、每条指令的底层落地机制,以及如何在 ChatGPT 中复现并运行一个以 Python 为引擎、以统计分析与可视化为核心的 Data Analysis GPT。
一、Data Analysis GPT 在 AutoExpert 生态中的定位
ChatGPT AutoExpert 是一套旨在提升 GPT-4 / GPT-3.5 对话模型响应深度与准确度的自定义指令集合,其仓库结构将提示词按用途划分为多个目录:
- standard-edition/:面向非编码类日常问答的"标准版"自定义指令;
- developer-edition/:面向编码任务、需要 GPT-4 与Advanced Data Analysis的"开发者版";
- _system-prompts/gpts/:从 ChatGPT 官方"Custom GPTs"中提取的系列系统提示词,其中就包括本文主角 data_analysis.md。
根据 Custom GPTs 总览 README 的登记表,官方商店中的 "Data Analysis" GPT 描述为"Drop in any files and I can help analyze and visualize your data"(拖入任意文件,即可帮你分析与可视化数据),其启用的工具仅为python——没有浏览器、没有 DALL·E。这决定了该 GPT 是一个"纯计算引擎"型智能体:一切能力都建立在代码执行之上。
值得注意的前提:官方 "Custom GPTs" 使用独立的gpt-4-gizmo模型,拥有独立的用量限制,且所有 Custom GPT 共享该限额,上下文大小为 32k(见 _system-prompts/gpts/README.md)。理解这一约束,有助于我们在设计分析任务时控制数据规模与上下文占用。
二、核心角色定义:数据集解释与分析助手
原提示词的第一段明确了该 GPT 的首要职能:
As a Data Analysis GPT, your primary function is to assist users in interpreting and analyzing complex data sets. You should respond to queries with clear, concise, and informative explanations.
可以提炼出四个关键词,它们构成了整个提示词的行为地基:
- Interpret(解释):不止于计算结果,还要把数据的业务含义讲清楚;
- Analyze(分析):主动执行统计检验、模式识别等分析动作;
- Clear & Concise(清晰简洁):回复要信息密度高、不绕弯,与 AutoExpert 一贯的"减少免责声明与废话"(Minimized Hand-Holding,见 README.md)理念一脉相承;
- Informative(有信息量):每条回复都要交付实质结论,而非空泛描述。
当用户以原始数据或描述性摘要(descriptive summary)两种形式提供数据时,该 GPT 都应启动自身能力:执行统计分析(statistical analyses)、生成可视化(visualizations)、给出洞见(insights)。同时,它被要求理解各种数据格式(various data formats)、识别显著模式(identify significant patterns),并基于实证证据给出结论(offer conclusions based on empirical evidence)——这是"数据驱动而非直觉驱动"的直接指令化表达。
从源码印证:数据格式能力的底层支撑
"理解各种数据格式"并非空话,其技术底座来自 ChatGPT 后端的工具链。在 _system-prompts/all_tools.md 中可以找到myfiles_browser工具:
search(query: str):对当前会话上传的文件执行检索并显示结果;open_url(url: str):按文档 ID(通常为 UUID)打开文档;click(id: str)、back()、scroll(amt: int)、quote_lines(start, end):定位、回溯、滚动与按行引用。
也就是说,用户上传的 CSV、Excel、JSON 等文件会先进入"文件浏览器"环节,GPT 通过检索与打开文档来完成格式识别与内容抽取,再交由 python 工具做真正的计算。建议在实际使用中,面对超大文件先让 GPT 用search定位关键列与抽样行,再决定是否全量读入,以规避 32k 上下文与 60 秒执行超时的双重限制。
三、响应准则:准确性优先与澄清机制
原提示词第二段写道:
In your responses, prioritize accuracy and relevance. When necessary, you may ask clarifying questions to ensure that your analyses meet the user's needs. You should maintain a professional tone and refrain from providing personal opinions or advice outside the scope of data analysis.
这里包含三条相互咬合的准则:
- 准确性优先(prioritize accuracy):结论必须可复核、可溯源,杜绝臆测;
- 澄清前置(clarifying questions):当分析目标模糊时,允许反问。例如"这份销售数据想比较的是月度同比还是环比?""异常值是否需要剔除,剔除标准是什么?"这类问题能显著提升后续分析的命中率;
- 角色边界(scope discipline):保持专业语气,不越界提供个人意见。数据分析 GPT 只回答"数据怎么说",不代替用户做商业决策。
这一"必要时提问、但不过度打扰"的设计,与 AutoExpert 开发者版中"Unless you're only answering a quick question…"的响应节奏(见 developer-edition/chatgpt__custom_instructions.md)是同构的:提问是手段,交付高质量分析才是目的。
四、Python 工具策略:复杂任务的代码执行通道
原提示词第三段是该 GPT 的"能力开关":
For tasks that involve extensive data, such as creating visualizations or running complex statistical models, you should utilize the Python tool to execute code. Remember to present your findings in a way that is understandable to users regardless of their statistical background.
要点有三:
- 触发条件:涉及大量数据、需要绘图、或需要跑复杂统计模型时,必须调用 python 工具执行代码,而不是"口头描述"应该怎么做;
- 呈现方式:无论用户的统计学背景如何,都要把结果翻译成可理解的语言——代码是内部引擎,自然语言才是交付界面;
- 隐含边界:并非所有任务都要开 Jupyter,简单计算可以走推理完成,这与开发者版"Unless running a command, don't use Jupyter"(developer-edition/chatgpt__about_me.md)的分流策略一致。
4.1 python 工具的运行环境(源码实证)
该 GPT 使用的 python 工具,其底层环境在 _system-prompts/advanced-data-analysis.md 中有精确描述:
When you send a message containing Python code to python, it will be executed in a stateful Jupyter notebook environment. python will respond with the output of the execution or time out after 60.0 seconds. The drive at '/mnt/data' can be used to save and persist user files. Internet access for this session is disabled.
据此可确认以下运行事实(这些是 ChatGPT Advanced Data Analysis 沙箱的公开约束,写入系统提示词):
| 特性 | 说明 |
|---|---|
| 执行环境 | 有状态(stateful)Jupyter notebook,跨代码单元格保留变量 |
| 单次超时 | 60.0 秒,超时返回超时提示 |
| 持久化存储 | /mnt/data目录可保存并跨会话持久化用户文件 |
| 网络访问 | 禁用,禁止外部 web 请求与 API 调用(会失败) |
| Python 版本 | 3.8,运行在 x86_64 架构 VM 上(见 developer-edition/README.md) |
对分析任务的直接启示:
- 分步执行:60 秒超时意味着大数据集应分块处理、分步建模,而非一次性跑完整个 pipeline;
- 善用 /mnt/data:中间结果(清洗后的 DataFrame、生成的图表文件)先落盘,再在后续单元格读取,既能绕开上下文限制,也为跨轮次分析保留状态;
- 离线分析:不要指望在分析过程中联网抓取外部数据,一切数据来源只能是用户上传的文件;
- 版本兼容:代码应面向 Python 3.8 编写,注意
pandas、matplotlib等库在该版本下的 API 兼容性。
4.2 数据分析的标准动作组合
结合原提示词与沙箱约束,一个规范的数据分析会话应包含以下动作序列:
- 文件接收与格式识别:用
myfiles_browser的search/open_url打开上传文件,识别格式(CSV、Excel、JSON 等)与结构(列名、类型、缺失值); - 探索性分析(EDA):在 python 中执行
df.head()、df.describe()、df.info()等,生成描述性统计摘要; - 统计建模:按需运行相关性分析、回归、假设检验等;
- 可视化:用
matplotlib/seaborn绘图,并把图表保存到/mnt/data供用户下载查看; - 结论呈现:用非技术语言总结发现、给出基于实证证据的结论,并说明数据局限。
五、隐私与伦理边界:个人数据的处理红线
原提示词第四段给出了数据安全守则:
You should not perform any actions that involve personal data unless explicitly provided by the user for analysis within the current session. Respect privacy and confidentiality at all times. If a task cannot be completed due to ethical concerns or data limitations, you must communicate this clearly to the user.
逐条拆解:
- 会话内使用原则:个人数据仅限用户在当前会话内明确提供、用于当次分析的场景,不得挪作他用;
- 全程保密:任何时候都要尊重隐私与机密性,不重复利用历史会话中的敏感数据;
- 显式沟通:因伦理问题或数据条件不足(如样本量太小、字段缺失)而无法完成任务时,必须如实告知用户,而不是硬凑结论。
这条准则与 AutoExpert 项目"减少免责声明但保留必要边界"的取向一致:不滥用合规话术堆砌篇幅,但在真正的红线(个人数据)面前绝不含糊。
六、教育角色:授人以渔的分析教练
原提示词最后一段定义了 GPT 的长期价值:
Lastly, you are to assist users in learning more about data analysis by providing explanations of concepts and methods when asked. This educational role is crucial as it empowers users to better understand and engage with their own data analysis tasks in the future.
这意味着 Data Analysis GPT 的职责不仅是"替用户算",还要在用户询问时解释:
- 概念层面:什么是 p 值、置信区间、中心极限定理;
- 方法层面:为什么选线性回归而不是决策树、缺失值填充有哪些策略及各自适用场景;
- 实践层面:教会用户读懂自己得到的图表与统计输出。
这种"解释 + 交付"的双通道设计,与仓库中开发者版的 Preamble/Epilogue 机制(每次响应开头声明语言、专家角色、需求与计划,结尾总结 History / Source Tree / Next Task,见 developer-edition/README.md)异曲同工:都是在提升单次回答质量之外,帮助用户建立对分析过程本身的掌控感。
七、实战配置:如何将本提示词部署为可用的 Data Analysis GPT
原文档本质上是可直接粘贴的系统提示词,配合 ChatGPT 的 Custom GPTs 功能即可落地。部署步骤如下:
- 进入 GPT Builder:在 ChatGPT 界面选择"Explore GPTs"→"Create",进入自定义 GPT 编辑页;
- 粘贴指令:将 _system-prompts/gpts/data_analysis.md 的完整文本粘贴到 Instructions(行为上下文)区域;
- 开启工具:在 Capabilities 中启用Code Interpreter / Advanced Data Analysis(对应仓库中的 python 工具),无需开启 Browsing 与 DALL·E;
- 配置交互信息:按 _system-prompts/gpts/README.md 中官方 Data Analysis GPT 的样子,设置名称"Data Analysis"、简介"Drop in any files and I can help analyze and visualize your data",并填写 welcome message 与几个起始提问(prompt starters),例如:
- "帮我分析这份销售数据的月度趋势"
- "这个 CSV 里哪些特征与目标变量相关性最强?"
- "为这份数据生成直方图与箱线图"
- "解释一下这份回归结果中每个系数的含义"
7.1 进阶:与开发者版 verbosity 机制的配合
若你同时使用 AutoExpert 开发者版(developer-edition/),可让数据分析代码的详细度完全可控:开发者版支持V=[0-3]前缀调节代码风格(V=0 极简 code golf,V=2 简单为默认,V=3 冗长且注重 DRY,见 developer-edition/README.md)。典型用法:
V=1:用 pandas 读取这个 Excel,统计每列缺失率—— 得到精简、无冗余的高效代码;V=3:对数据进行完整的探索性分析并可视化—— 得到模块化、带注释的完整 pipeline。
7.2 版本选择提醒
如果你需要的是"聊天 + 编码一体"的增强体验,仓库还提供两条路径:
- 标准版(standard-edition/):面向非编码任务,含自动改写问题、斜杠命令、框架自动选择等能力;
- 开发者版(developer-edition/):需 ChatGPT Pro 订阅(GPT-4 + Advanced Data Analysis),附带 autodev.py 配套脚本,支持
/memory会话记忆打包、自定义 wheel 安装、文件/符号树维护等。
本文所讲的 Data Analysis GPT 提示词则是"开箱即用、专注分析"的轻量方案,适合不想引入完整开发者版、只需一个专职数据分析助手的场景。
八、小结:九行提示词背后的设计哲学
回看 _system-prompts/gpts/data_analysis.md 全文——它仅九行英文,却完成了五层行为设计:
| 层级 | 原文要点 | 落地机制 |
|---|---|---|
| 角色 | 解释与分析复杂数据集 | 清晰、简洁、有信息量的回复格式 |
| 能力 | 统计分析、可视化、洞见 | 调用 python 工具,Jupyter 沙箱执行 |
| 质量控制 | 准确性优先、必要时澄清 | 反问前置、专业语气、边界内不越权 |
| 合规 | 个人数据会话内使用、隐私保密 | 伦理/数据不足时显式沟通 |
| 增值 | 教育角色 | 应询解释概念与方法 |
这五层设计彼此咬合:角色定义能力范围,能力由工具承载,工具受环境约束(60 秒超时、无网络、/mnt/data 持久化),约束倒逼出分步执行与落盘策略,而教育角色则让每一次分析都沉淀为用户的可迁移技能。对于任何想打造"数据分析型智能体"的开发者或提示词工程师,这份提示词都是一份结构精炼、可直接复用的范本。
延伸阅读(仓库内):
- Data Analysis GPT 原始系统提示词
- Custom GPTs 总览与工具配置表
- Advanced Data Analysis 底层系统提示词(python 工具环境约束)
- 全量工具说明(含 myfiles_browser 文件浏览机制)
- 开发者版使用手册(verbosity、斜杠命令、安装流程)
- 开发者版自定义指令全文(Preamble / Epilogue 模板)
- 开发者版 about_me(wheels 安装与 Jupyter 使用策略)
- 标准版自定义指令(V=1~5 详细度分级参考)
- 提示工程
- AI 应用
- AI Agent
【免费下载链接】ChatGPT-AutoExpert
🚀🧠💬 Supercharged Custom Instructions for ChatGPT (non-coding) and ChatGPT Advanced Data Analysis (coding).
相关推荐
The Rizz Game GPT 提示词架构解析:随机化角色扮演与难度分级的系统化设计
The Rizz Game GPT 提示词架构解析:随机化角色扮演与难度分级的系统化设计 The Rizz Game 是一个以"尝试要到她的电话号码"为目标的对
提示工程Screenplay GPT 提示词深度解析:Script Smith 编剧创作系统的设计原理与实战用法
Screenplay GPT 提示词深度解析:Script Smith 编剧创作系统的设计原理与实战用法 本文基于 GPTs 仓库( README.md htt
提示工程Professor Synapse 提示词框架深度解析:用 Synapse_CoR 编排多专家智能体的 GPT 系统设计
Professor Synapse 提示词框架深度解析:用 Synapse_CoR 编排多专家智能体的 GPT 系统设计 本仓库( GPTs https://l
提示工程
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考