20 分钟跑通 RD-Agent:AI 数据科学研发自动化的安装配置与首跑教程
【免费下载链接】RD-AgentResearch and development (R&D) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of R&D are mainly focused on data and models. We are committed to automating these high-value generic R&D processes through R&D-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-Agent
RD-Agent 是微软开源的 LLM Agent 框架,用于自动化数据驱动的研发流程:自动提出假设、生成代码、执行实验并根据反馈迭代,覆盖数据科学竞赛、量化因子与模型进化、LLM 微调等场景。本文按"装环境 → 配 LLM → 跑通首任务 → 排查卡点"的真实操作链路展开,适合准备上手的算法工程师和数据科学新手,从零到首次运行只需一个终端。
🐳 准备工作:三条硬性要求与安装
环境清单先过一遍
RD-Agent 目前仅支持 Linux。Python 使用 3.10 或 3.11(CI 实测过的两个版本,pyproject.toml要求 ≥3.10,仓库同时提供constraints/3.10.txt、constraints/3.11.txt用于锁定依赖)。多数场景依赖 Docker 隔离执行代码,当前用户必须能免 sudo 运行 Docker,用docker run hello-world验证即可。
两种安装方式
普通用户直接从 PyPI 安装,先建好 conda 环境再装包:
conda create -n rdagent python=3.10 -y conda activate rdagent pip install rdagent要跟进最新版或参与贡献,则克隆源码后执行make dev(Makefile 里已串好可编辑安装、依赖与钩子):
git clone https://gitcode.com/GitHub_Trending/rd/RD-Agent cd RD-Agent && make dev装完执行rdagent --help,能看到fin_factor、data_science、health_check等子命令即代表入口正常。
⚙️ 配置 LLM:.env 放哪、怎么验
.env 与最小可用配置
rdagent命令启动时会自动加载当前目录下的.env,仓库根目录自带模板 .env.example,复制为.env后填值即可。核心是CHAT_MODEL与EMBEDDING_MODEL两项,默认后端为 LiteLLM(见rdagent/oai/llm_conf.py)。最易踩的坑:embedding 若与 chat 不同服务商,EMBEDDING_MODEL必须加litellm_proxy/前缀并单独配 key 与 base。DeepSeek 没有 embedding 模型,官方给出的组合是"DeepSeek 对话 + SiliconFlow 向量":
CHAT_MODEL=deepseek/deepseek-chat DEEPSEEK_API_KEY=<DeepSeek 密钥> EMBEDDING_MODEL=litellm_proxy/BAAI/bge-m3 LITELLM_PROXY_API_KEY=<SiliconFlow 密钥> LITELLM_PROXY_API_BASE=https://api.siliconflow.cn/v1若用输出含思考过程标签的推理模型,再加一行REASONING_THINK_RM=True。
最快验证命令
rdagent health_check这一条命令会连测三件事:Docker 是否可用、UI 默认端口 19899 是否被占、chat 与 embedding 模型是否真实调通。看到 "All tests completed" 才能进入下一步。
🚀 首次运行:内置医疗预测任务
选一个开箱即用的竞赛跑通
数据科学场景统一入口是rdagent data_science --competition <竞赛名>。仓库内置示例任务 arf-12-hours-prediction-task(12 小时心率预测),按 README 示例下载数据解压后,设置数据目录与场景类再启动:
dotenv set DS_LOCAL_DATA_PATH "$(pwd)/git_ignore_folder/ds_data" dotenv set DS_SCEN rdagent.scenarios.data_science.scen.DataScienceScen rdagent data_science --competition arf-12-hours-prediction-task之后 Agent 会循环执行"数据加载 → 特征工程 → 模型训练 → 集成评估",每轮把指标反馈给下一轮假设,全程无需人工改代码。
用 UI 观察执行过程
另开一个终端启动监控页:
rdagent ui --port 19899 --log-dir log/ --data-scienceStreamlit 页面实时展示数据科学场景的日志与 trace。若端口被占,可先跑rdagent health_check --no-check-env --no-check-docker查看可用端口,再用--port换端口。
🔧 常见卡点与场景扩展
高频报错的排查顺序
- Docker 报错:先确认 daemon 已启动、当前用户在 docker 组(免 sudo),这是 health_check 里最常见的失败项。
- chat 通过但 embedding 失败:九成是
litellm_proxy/前缀漏加或LITELLM_PROXY_API_BASE写错;模型名必须与 LiteLLM 支持的命名一致。 - 端口冲突:19899 是 UI 默认端口,换
--port即可。 - 本地无 Docker 想跑通:在
.env设置DS_CODER_COSTEER_ENV_TYPE=conda(数据科学场景)或MODEL_COSTEER_ENV_TYPE=conda(量化场景),让代码改在本地 conda 环境执行,完整说明见安装与配置文档。
换场景:Kaggle 与量化
Kaggle 竞赛:把kaggle.json放到~/.config/kaggle/,.env里将DS_SCEN指向KaggleScen类、DS_IF_USING_MLE_DATA=True,即可用同一条rdagent data_science命令按名跑比赛(内置模板如 tabular-playground 系列可参考rdagent/scenarios/kaggle/experiment/templates/)。量化方向用rdagent fin_factor(因子进化)、fin_model(模型进化)、fin_quant(因子+模型联合进化)三条命令覆盖。
下一步
- 安装与配置文档:LiteLLM 各服务商配置与执行环境细节
- 数据科学示例任务:示例竞赛数据与说明文件
- 场景目录:金融、医疗、通用场景的完整清单
- 贡献指南:提交 Issue 与参与开发的入口
【免费下载链接】RD-AgentResearch and development (R&D) is crucial for the enhancement of industrial productivity, especially in the AI era, where the core aspects of R&D are mainly focused on data and models. We are committed to automating these high-value generic R&D processes through R&D-Agent, which lets AI drive>项目地址: https://gitcode.com/GitHub_Trending/rd/RD-Agent
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考