自动化抓取和整理新闻数据已成为信息聚合和内容创作中的高频需求。围绕36氪热榜新闻的自动采集与处理,可以高效实现科技资讯的结构化输出和多场景复用。
本文介绍一套以Dify工作流为核心,结合大语言模型和Python代码节点,自动完成36氪热榜新闻从抓取、解析到格式化输出的全链路流程,适合编程初学者实践和项目落地。
文章目录
- 抓取获取36氪
- 核心模型
- Node节点
- 工作流程
- 应用场景
- 开发与应用
抓取获取36氪
该工作流的目标是自动抓取36氪网站的热榜新闻内容,完成新闻数据的获取、整理与内容提取。需要准备的素材主要是36氪热榜的API接口数据,通过发送HTTP请求获取最新的新闻列表和详情。工作流程依次包括请求36氪热榜接口、调用大语言模型(LLM)将返回的JSON数据梳理为新闻数组格式、解析新闻列表为结构化数据、迭代请求各新闻的正文内容,再由LLM对新闻正文进行提炼和格式化,最终生成包含新闻标题、日期和正文的完整新闻内容。整体过程自动化且模块化,适合初学者使用,实现从网络新闻抓取到内容呈现的完整链条。
核心模型
| 模型名称 | 说明 |
|---|---|
| deepseek-ai/DeepSeek-V2.5 | 用于解析和梳理新闻JSON数据,以及提炼新闻正文内容的大语言模型,辅助文本结构化处理。 |
Node节点
| 节点名称 | 说明 |
|---|---|
| 开始 (start)</ |