news 2026/9/18 11:26:07

Gemini 3 登顶 MArena:拿 TaoToken 复现榜单同款对话

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Gemini 3 登顶 MArena:拿 TaoToken 复现榜单同款对话

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

1. 先确认 MArena 上的是哪个 Gemini 3

LMArena(原 Chatbot Arena)的榜单页会随投票滚动更新,同一模型在不同日期、不同子榜(Overall / Coding / Hard Prompts)上的名次并不一致。所以复现之前,先把「登顶」这件事拆成可核对的三件事:榜名、查阅日期、具体名次或分数,以及页面来源。本文不引用任何未经核实的 ELO 数字,只写复现流程和本地 Token 记录。

我这次的做法是:打开 LMArena 的 Leaderboard 页面,记下查阅日期,找到 Gemini 3 系列在 Overall 榜上的位置,把模型在页面上的完整显示名抄下来(例如gemini-3-pro这类带版本后缀的写法)。这一步很关键,因为榜单上的展示名和 API 里的模型 ID 经常不是同一个字符串——榜单可能写「Gemini 3 Pro」,而模型广场里挂的是另一个 ID。两者对不上,后面切模型就会 404。

需要说明的是:公榜上参赛的是模型本身,不是任何 API 通道。TaoToken 在这里的角色是统一 API 基线——你在 TaoToken 创建 Key、拿到 Base URL,然后把请求打到同一个 Gemini 3 模型上。榜单名次归模型,通道归通道,这两件事在本文里始终分开写。

复现的目标不是「验证 Gemini 3 是不是第一」,那需要跑完整投票集,个人做不了。目标是:用同一套提示集,在本地把 Gemini 3 的对话手感跑一遍,记录每组对话的 Token 消耗,形成一张可对照的本地表。这张表只代表我这一次运行,不代表公榜。

1.1 榜单快照要记哪几个字段

如果你也要做这件事,建议在动手前先建一个记录文件,至少包含:

字段说明
榜名LMArena / Chatbot Arena,写全
查阅日期精确到日,例如 2025-XX-XX
子榜Overall / Coding / Hard Prompts,选一个
模型显示名页面上原样抄写
名次或分数页面显示什么写什么,不换算
页面来源榜单 URL

这六个字段缺一个,后面的「复现」就没有锚点。尤其是查阅日期——榜单每天在动,今天的第一和上周的第一可能不是同一个模型。

1.2 官方模型名 vs 广场 ID

榜单显示名和 API 模型 ID 的差异是复现里最容易翻车的地方。我的处理方式是:先在 TaoToken 的模型广场里搜「gemini」,看当前挂出来的 Gemini 3 系列 ID 长什么样,再拿这个 ID 去填客户端。模型 ID 一律以模型广场为准,不要凭记忆写,也不要把榜单显示名直接当 ID 用。

如果广场里同时有多个 Gemini 3 变体(比如带-pro-flash后缀的),先确认你要复现的是榜单上那一个。选错了变体,对话手感对不上,Token 消耗也对不上。

2. 把 Base URL 填进客户端,再切到 Gemini 3

这一步是整篇的核心操作。TaoToken 出现在「切模型」这个动作里:Key 和 Base URL 是入口,模型列表里选 Gemini 3 是切换点。

2.1 创建 Key 与确认 Base URL

在 TaoToken 控制台 创建一把 API Key,占位符记作YOUR_API_KEY。Base URL 固定写:

https://taotoken.net/api

注意末尾不带/v1。很多客户端默认会自己拼/v1/chat/completions,你只要把根地址填对就行。填成https://taotoken.net/api/v1反而会拼出/v1/v1/...,直接 404。

2.2 通用客户端填法

大多数支持 OpenAI 兼容协议的客户端(Chatbox、NextChat、各类桌面端)填三个字段:

字段
API Base / Base URLhttps://taotoken.net/api
API KeyYOUR_API_KEY
Model模型广场里的 Gemini 3 ID

填完保存,在模型下拉里切到 Gemini 3,发一条「你好」确认连通。连通了再进正式提示集。

2.3 Claude Code 的接法

如果你习惯在 Claude Code 里跑对话,走环境变量或~/.claude/settings.jsonenv段:

export ANTHROPIC_BASE_URL="https://taotoken.net/api" export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY" export ANTHROPIC_MODEL="模型广场里的 Gemini 3 ID"

或者写进~/.claude/settings.json

{ "env": { "ANTHROPIC_BASE_URL": "https://taotoken.net/api", "ANTHROPIC_AUTH_TOKEN": "YOUR_API_KEY", "ANTHROPIC_MODEL": "模型广场里的 Gemini 3 ID" } }

三件套里ANTHROPIC_MODEL必须和广场 ID 一致,写错就是模型不存在。Claude Code 的详细接入步骤可以对照 Claude Code 接入文档。

2.4 Codex 的接法

Codex 走的是另一套配置,别把ANTHROPIC_*套上去。改~/.codex/config.toml

model = "模型广场里的 Gemini 3 ID" model_provider = "taotoken" [model_providers.taotoken] name = "TaoToken" base_url = "https://taotoken.net/api" env_key = "TAOTOKEN_API_KEY"

然后在环境里导出TAOTOKEN_API_KEY=YOUR_API_KEY。Codex 和 Claude Code 的配置字段完全不同,混用是最常见的 401 来源。

2.5 CC Switch 的接法

用 CC Switch 管理多供应商时,新增一个自定义供应商:

  • 供应商名:TaoToken
  • Base URL:https://taotoken.net/api
  • API Key:YOUR_API_KEY
  • 模型 ID:模型广场里的 Gemini 3 ID

保存后切到这个供应商,再在模型列表里选 Gemini 3。CC Switch 的好处是切换供应商不用改环境变量,适合同时挂着多个通道做对照。

2.6 切换后先做一次连通性检查

切完模型别急着跑提示集,先发一条短消息,确认返回正常、没有 401/404。这一步能挡掉大部分配置错误。如果报 401,先查 Key 有没有复制全、有没有多余空格;如果报 404,先查模型 ID 是不是和广场一致、Base URL 末尾有没有多写/v1

3. 五组同款对话:提示集与 Token 记录

提示集我固定五组,覆盖不同对话类型,方便看手感差异。每组都记录输入 Token、输出 Token、总 Token。下面的数字是我这一次运行的结果,只代表本地一次运行,不代表公榜,也不构成对模型能力的排名。

3.1 提示集设计

五组提示按难度和类型分层:

  1. 事实问答:一个需要准确回忆的问题,看模型会不会编。
  2. 多步推理:一道需要中间步骤的题,看推理链是否完整。
  3. 长文改写:给一段 300 字左右的文字,要求压缩到 100 字以内,看信息保留度。
  4. 代码解释:给一段有 bug 的代码,要求指出问题并给修复思路,看定位准不准。
  5. 开放式建议:一个没有标准答案的规划类问题,看结构性和可执行性。

这五组不追求覆盖所有能力,只求类型分散,让 Token 消耗和手感都有对照价值。

3.2 本地复现记录表

组号类型输入 Token输出 Token总 Token完成情况
1事实问答以控制台用量页为准以控制台用量页为准以控制台用量页为准完成
2多步推理以控制台用量页为准以控制台用量页为准以控制台用量页为准完成
3长文改写以控制台用量页为准以控制台用量页为准以控制台用量页为准完成
4代码解释以控制台用量页为准以控制台用量页为准以控制台用量页为准完成
5开放式建议以控制台用量页为准以控制台用量页为准以控制台用量页为准完成

这里我没有填具体数字,原因是:Token 计数依赖客户端和通道的统计口径,不同客户端报的数可能不一致。要拿到可信的数字,应该以 TaoToken 控制台的用量页为准,把每次调用的实际消耗抄进表里。凭客户端界面上的估算值填表,误差可能很大。

3.3 怎么把 Token 数字填准

跑完一组后,去控制台的用量记录里找对应时间戳的调用,抄下输入和输出 Token。五组跑完,汇总成上面的表。这张表的价值在于:同一把 Key、同一套提示、同一时间段,横向对比五组对话的消耗结构。哪类提示吃 Token 多,一目了然。

需要再强调一次:这张表是本地一次运行的结果,不是公榜数据,也不能拿来和 LMArena 的 ELO 放一起比较。公榜表在第一节,本地表在这一节,两张表分开看。

3.4 手感记录怎么写

除了 Token,建议每组补一句主观记录:回答是否切题、有没有明显幻觉、结构是否清晰。这部分不写数字,只写观察。比如事实问答组如果模型给了不确定的答案,就记「该组出现一次不确定表述」;代码解释组如果定位准确,就记「一次定位到问题行」。这些观察和 Token 数字配合,才是完整的复现记录。

4. 复现时容易踩的配置坑

这一节只写本篇配置相关的错误,不展开通用排障。

4.1 模型 ID 写错

最常见的是把榜单显示名当模型 ID。榜单写「Gemini 3 Pro」,你就在客户端填「Gemini 3 Pro」,结果 404。正确做法是去模型广场抄实际 ID。模型 ID 一律以模型广场为准。

4.2 Base URL 多写 /v1

https://taotoken.net/api是根地址,末尾不要加/v1。加了之后客户端再拼一次,路径就重复了。这个错误在 OpenAI 兼容客户端里特别常见,因为很多客户端的默认模板里 Base URL 是带/v1的,替换时容易连/v1一起带进去。

4.3 Claude Code 与 Codex 配置混用

ANTHROPIC_*只给 Claude Code 用,Codex 走~/.codex/config.toml。把ANTHROPIC_BASE_URL塞进 Codex 的环境里,Codex 不认,直接连不上。两套配置分开维护。

4.4 Key 复制带空格

从控制台复制 Key 时,前后容易带上空格或换行。填进客户端后表现为 401。粘贴后手动检查一遍首尾字符。

4.5 切换模型后没重连

有些客户端切换模型后需要重新建立会话,旧会话还挂在之前的模型上。切完模型新建一个对话再发消息,避免拿旧会话的结果当新模型的输出。

5. 用同一把 Key 复现对照表

五组对话跑完、Token 抄进表之后,建议做两件事收尾。

第一件,打开 模型对话 确认 Gemini 3 的模型 ID 和广场一致,顺便再发一条短消息,验证这次评测的调用是否正常入账。如果用量页能看到刚才的调用记录,说明整条链路是通的。

第二件,如果你打算长期做这类复现,可以看 Coding Plan,把多模型对照的调用集中管理。Key 在 控制台 创建,Claude Code / CC Switch 的三件套配置对照 接入文档。

复现这件事的价值不在「证明谁第一」,而在你手里有了一张自己跑出来的对照表:同一套提示、同一把 Key、同一时间段,五组对话的 Token 消耗和手感记录都在。下次榜单变动,你换一个模型 ID 再跑一遍,两张表就能横向比。榜单归榜单,你的表归你的表。

🚀 告别海外账号与网络限制!稳定直连全球优质大模型,限时半价接入中。 👉 点击领取海量免费额度

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/18 11:25:55

嫌订阅费肉疼?5 款免费矢量设计工具够你用到下班

嫌订阅费肉疼?5 款免费矢量设计工具够你用到下班 【免费下载链接】Adobe-Alternatives A list of alternatives for Adobe software 项目地址: https://gitcode.com/GitHub_Trending/ad/Adobe-Alternatives 上周接到一个改 Logo 的活儿,打开软件才…

作者头像 李华
网站建设 2026/9/18 11:22:51

【ComfyUI】多模型 户型图风格渲染效果图

今天给大家演示一个 室内户型图风格渲染生成效果图 ComfyUI 工作流。 该工作流能够将普通的户型平面图输入后,自动识别空间布局,生成包含房间名称、面积与结构说明的完整空间描述,并结合 AI 文本生成模型和渲染模型,实现从平面图到室内效果图的自动生成。它融合了语言理解与…

作者头像 李华
网站建设 2026/9/18 11:18:13

SAP物料成本视图原始组:成本构成拆分与物料账应用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/18 11:18:04

【ComfyUI】QwenImage + Control 边缘引导图生图

今天展示的案例是一个基于 Qwen-Image 模型的 ComfyUI 工作流,整个流程通过加载扩散模型、VAE、LoRA 以及 CLIP 编码器,结合提示词和参考图像实现从图像输入到艺术风格化再输出的完整链路。 效果上能够展现高度写实与艺术化并存的图像创作,尤其在复杂构图、光影细节和笔触模…

作者头像 李华
网站建设 2026/9/18 11:17:29

【ComfyUI】HiDream_I1 Dev28基础文生图

今天展示的案例是一个基于 HiDream-I1 模型的 ComfyUI 工作流。该流程结合了多种模型加载、正负提示词编码、采样生成以及图像解码与保存的完整链路,能够实现从文本到图像的高质量生成。 工作流中还包含详细的采样设置说明,确保生成结果在速度、效果与显存占用之间取得平衡。…

作者头像 李华