news 2026/8/15 13:33:34

AI Agent白手起家16: DeepSeek云端部署与API调用实战指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI Agent白手起家16: DeepSeek云端部署与API调用实战指南

纲要

  • 为何选择云端部署与 API 调用
    • 低成本获取高性能算力
    • 免去本地硬件与运维负担
  • 三种资源获取方案对比
    • 本地部署、云端部署、API 调用的核心差异
  • 方案一:腾讯云一键部署 DeepSeek
    • 创建高性能应用服务实例
    • 选择社区应用,计费模式与区域配置
    • GPU 选型建议(基础型 vs 进阶型)
    • 使用 Open WebUI 直接对话
    • 获取 API 端点与公网 IP
  • 方案二:官方 API 与硅基流动
    • DeepSeek 官方开放平台
    • 硅基流动模型广场与计价
    • API Key 创建与模型选择
  • 统一接入:将云端模型导入本地 Cherry Studio
    • 添加自定义 OpenAI 兼容服务
    • 验证连接与模型切换
  • 代码实战:用 Python 调用云端 API
    • 通过公网 IP + 端口调用腾讯云部署的模型
    • 通过硅基流动 API 调用满血版 R1
    • 完整可运行脚本
  • 总结与最佳实践

为何选择云端部署与 API 调用

对于大多数个人开发者和中小团队,本地部署虽然能实现完全的数据私有化,但受限于 GPU 显存与算力,往往只能流畅运行 7B~14B 的量化模型,且需承担较高的硬件采购成本。而云端部署API 调用提供了另一种思路:按需付费、弹性伸缩,用几分钱就能调用满血版 671B 的推理能力

目前国内主流云服务商(如腾讯云、阿里云)已光速集成 DeepSeek,提供一键部署的社区应用;同时第三方模型即服务平台(如硅基流动)也提供了丰富的蒸馏版本和满血版 API,极大地降低了使用门槛。

三种资源获取方案对比

方案适用场景模型范围初始成本运维成本隐私性
本地部署高隐私、内网运行1.5B~32B(量化)高(显卡)低(电费)极高
云端部署需要高性能、弹性算力最高 32B(一键包),可自行部署更高中(按时计费)中(可控)
API 调用快速验证、低频调用全量模型,含 671B按 token 计费依赖供应商

方案一:腾讯云一键部署 DeepSeek

腾讯云高性能应用服务(HAI)已将 DeepSeek 封装为社区应用,几分钟即可拉起一个带 GPU 的推理实例。

创建实例

  1. 登录腾讯云控制台,进入「高性能应用服务」产品页。
  2. 点击「新建」,在「社区应用」中选择DeepSeek-R1-7B/14B/32B(推荐 32B 以获得最佳性能)。
  3. 计费模式:测试可选择「按量计费」;长期使用可考虑包年包月。
  4. 地域选择离自己最近的(如北京)。
  5. 算力方案:建议选择 GPU 进阶型(显存 32 GB),基础型(16 GB 显存)在跑 32B 时体验较慢。
  6. 设置实例名称,勾选协议,点击「立即购买」。

登录腾讯云控制台

高性能应用服务 HAI

新建实例

选择社区应用 DeepSeek-R1-32B

选择 GPU 进阶型

按量计费 / 确认地域

创建实例并等待 2~5 分钟

获取公网 IP 与端口

直接使用 Open WebUI

实例运行后,点击「Open WebUI」即可打开网页版对话界面。首次进入会提示创建管理员账号,之后便可直接选择已部署的模型(1.5B~32B)进行对话,体验丝滑的思维链推理。

获取 API 接口

在实例详情页的「监控」或「端口配置」中,可以看到开放的端口列表。通常6399端口映射到内部的80端口,提供 OpenAI 兼容的 API。你需要记录:

  • 公网 IP:实例详情中显示。
  • 端口:例如6399
  • API 基础路径http://<公网IP>:6399/v1

通过浏览器访问http://<公网IP>:6399/v1/models应能返回当前加载的模型列表,证明接口可用。

方案二:官方 API 与硅基流动

DeepSeek 官方开放平台

访问platform.deepseek.com可直接创建 API Key。但目前由于用户量巨大,官方暂时停止充值,存量余额可继续使用。模型提供deepseek-chat(V3)和deepseek-reasoner(R1),价格透明,百万 token 输入仅需 1 元(命中缓存更便宜)。

硅基流动(SiliconFlow)

siliconflow.cn是一个模型即服务平台,部署了大量开源模型,包含满血版DeepSeek-R1-671BDeepSeek-V3-671B以及多种蒸馏版本。注册并实名认证后,在「模型广场」选择模型,即可获取 API Key 和调用地址。

推荐模型与价格参考

模型参数量输入价格 (百万 token)输出价格 (百万 token)
DeepSeek-R1-Pro671B¥4¥16
DeepSeek-R1-Distill-Qwen-32B32B较低较低
DeepSeek-V3671B¥2¥8

调用端点统一为https://api.siliconflow.cn/v1,兼容 OpenAI 格式。

统一接入:将云端模型导入本地 Cherry Studio

无论你使用腾讯云自建 API 还是硅基流动,都可以将它们添加到 Cherry Studio 中,实现本地统一的 AI 助手界面。

  1. 打开 Cherry Studio → 设置 → 模型服务 → 添加。
  2. 提供商类型选择OpenAI,名称自定义(如“腾讯云 R1”)。
  3. API 地址填写:
    • 腾讯云:http://<公网IP>:6399/v1
    • 硅基流动:https://api.siliconflow.cn/v1
  4. API Key 填写对应的密钥(腾讯云可随意填写,硅基流动填写在平台生成的 key)。
  5. 点击「管理」,在列表中勾选你需要使用的模型,保存。
  6. 点击「检查」确认连接成功,随后即可在聊天界面切换模型。

代码实战:用 Python 调用云端 API

下面的脚本演示了如何通过 OpenAI 兼容接口分别调用腾讯云自部署的 32B 模型和硅基流动的满血版 R1,并对比输出。请根据你的实际情况替换 IP、端口和 API Key。

importopenai# ================= 配置区 =================# 腾讯云自部署(请替换为你的公网 IP 和端口)TENCENT_BASE_URL="http://123.123.123.123:6399/v1"# 替换为实际 IP:端口TENCENT_API_KEY="any-string"# 本地部署随意TENCENT_MODEL="deepseek-r1:32b"# 实例中的模型名# 硅基流动(请替换为你的 API Key)SILICON_BASE_URL="https://api.siliconflow.cn/v1"SILICON_API_KEY="sk-your-silicon-key"# 替换为真实 KeySILICON_MODEL="Pro/deepseek-ai/DeepSeek-R1"# 满血版 R1# ==========================================client_tencent=openai.OpenAI(base_url=TENCENT_BASE_URL,api_key=TENCENT_API_KEY)client_silicon=openai.OpenAI(base_url=SILICON_BASE_URL,api_key=SILICON_API_KEY)question="如何用 Python 实现快速排序?请给出带注释的代码。"print("===== 腾讯云 32B 模型 =====")resp_t=client_tencent.chat.completions.create(model=TENCENT_MODEL,messages=[{"role":"user","content":question}],temperature=0.3,max_tokens=600)print(resp_t.choices[0].message.content)print("\n===== 硅基流动 满血 R1 =====")resp_s=client_silicon.chat.completions.create(model=SILICON_MODEL,messages=[{"role":"user","content":question}],temperature=0.3,max_tokens=600)print(resp_s.choices[0].message.content)

运行说明

  • 安装依赖:pip install openai
  • 若腾讯云实例未启动,需先在控制台开机,并确保安全组允许对应端口的入站访问。
  • 硅基流动需提前注册并创建 API Key,注意模型名称可能会变动,请以平台实际显示为准。

总结与最佳实践

  • 快速体验:优先使用硅基流动或官方 API,成本极低,上手最快。
  • 团队协作或高隐私:可选择腾讯云 HA 实例部署自己的推理服务,独享 GPU,数据留存可控。
  • 生产环境:注意 API 调用速率限制(硅基流动有 RPM/TPM 限制),必要时购买更高等级套餐;自建服务需配置合适的 GPU 型号以平衡成本与性能。
  • 养成用完即关的习惯(腾讯云实例可存档或销毁),避免产生不必要的费用。

无论选择哪种方式,DeepSeek 的生态已经让“调用世界级大模型”变得像调用本地函数一样简单。接下来,你就可以将这些 API 集成到自己的 AI Agent 中,开始构建真正的智能应用。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/15 13:30:18

LLM 代码生成与审查:把补丁放回编译、测试和人工门禁

LLM 代码生成与审查&#xff1a;把补丁放回编译、测试和人工门禁 模型能生成补丁&#xff0c;也能生成看似合理的错误。接入研发流程时&#xff0c;输出必须回到现有类型检查、测试、安全扫描和代码审阅。 限制输入和修改范围 任务说明包含目标文件、禁止改变的接口与验收命令。…

作者头像 李华
网站建设 2026/8/15 13:28:08

140、顶会注意力机制复现(五):Scale-AwareAttention尺度感知注意力在YOLOv12多尺度检测中的适配——论文解析与VisDrone小目标涨点实验

140、顶会注意力机制复现(五):Scale-AwareAttention尺度感知注意力在YOLOv12多尺度检测中的适配——论文解析与VisDrone小目标涨点实验 兄弟们,今天这篇咱们聊个硬核的。上周有个读者私信我,说他在VisDrone上把YOLOv12的输入分辨率从640拉到1280,mAP50倒是涨了3个点,但…

作者头像 李华
网站建设 2026/8/15 13:27:17

Spring Boot静态资源同步与缓存管理:从原理到实践

1. 问题引入&#xff1a;一个看似简单却频繁发生的线上“灵异事件” 你有没有遇到过这种情况&#xff1f;本地开发环境跑得好好的&#xff0c;前端页面样式、图片、JavaScript脚本都显示正常。你信心满满地将代码打包、部署到线上服务器&#xff0c;结果用户反馈页面样式错乱、…

作者头像 李华
网站建设 2026/8/15 13:27:05

MySQL 8.0 Connector/J JDBC驱动下载、配置与连接问题全解析

1. 项目概述&#xff1a;为什么MySQL Connector/J这么重要&#xff1f; 如果你正在用Java开发一个需要连接MySQL数据库的应用&#xff0c;那么你迟早会碰到一个绕不开的环节&#xff1a;配置JDBC驱动。这个驱动&#xff0c;就是MySQL官方提供的Connector/J。听起来很简单&#…

作者头像 李华
网站建设 2026/8/15 13:25:03

大模型推理优化:Proxima KV Cache压缩策略解析与vLLM实践

在实际的大模型推理服务中&#xff0c;GPU显存是决定并发能力和吞吐量的核心瓶颈。尤其是在使用vLLM这类高性能推理框架时&#xff0c;KV Cache&#xff08;键值缓存&#xff09;会随着请求的上下文长度和批处理大小线性增长&#xff0c;迅速耗尽宝贵的显存资源&#xff0c;导致…

作者头像 李华