news 2026/10/3 11:17:03

AIMO2冠军方案深度解析:从SFT到强化学习的数学推理优化实战

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AIMO2冠军方案深度解析:从SFT到强化学习的数学推理优化实战

AIMO2在2025年春天的Kaggle赛场上把AI数学推理这个方向又抬上了一个台阶,总奖池超过200万美金,这个数字放在任何竞赛里都足够打眼。我前前后后也刷过不少Kaggle的NLP和CV赛道,但这套数学竞赛题的玩法跟平时做文本分类、问答完全不是一个路子:它对模型每一步推理的准确性、对中间过程的约束、对最终答案的精确定位,要求都极其严苛。当时围观冠军方案出来之后,我花了不少时间把公开的技术分享和代码理了一遍,发现这套冠军方案虽然看起来“只是”把SFT、强化学习、推理时采样这几个常见模块串起来,但每一环的细节都很有讲究,尤其是强化学习阶段对奖励的设计,几乎决定了最终能走多远。

这篇文章我就以技术复盘的角度,把AIMO2冠军方案的思路从头到尾拆一遍。重点会放在三个层面:数据怎么准备、强化学习怎么训练、推理时怎么把计算量转化为分数。适合正在做LLM推理优化、打算冲Kaggle数学类竞赛、或者想系统性了解“RL提升模型数学能力”这套打法的朋友。我会尽量把“为什么这么做”讲透,而不是只给一个配置清单。

1. 先认识AIMO2:它到底考的是什么

1.1 赛制与任务定义

AIMO(AI Mathematical Olympiad)是XTX Markets发起的一项面向AI系统的数学奥林匹克挑战,目标是让模型解决类似IMO风格的数学题。AIMO2(Progress Prize 2)在Kaggle上落地,竞赛要求参赛者提供一个模型,能够对给定的数学题目输出一个0到999之间的整数答案。这里的“数学题”不是简单四则运算,而是覆盖数论、组合数学、代数、几何等多个分支的竞赛题风格问题。

题目由程序化方式生成(procedurally generated),这意味着测试集里的题目要么是训练阶段从未见过的变体,要么是经过组合改写的衍生题。很多参赛队伍会在公开数据集上反复调模型,跑到一个很漂亮的本地验证分数,结果一上LB就崩,核心原因就是“分布外”(Out-of-Distribution,OOD)问题太严重了。AIMO2的评分直接以答案的整数精确匹配为准,没有中间分,对就是对、错就是错,所以对模型的推理能力要求是零容错的。

整个比赛分Public LB和Private Leaderboard两个阶段,Public阶段展示前30%的评测结果供参赛者观察,最终排名由Private holdout数据决定。因此,这个比赛天然把“泛化能力”放在首位,一个只会记住训练集答案分布的模型,在这里很难拿到好名次。

1.2 为什么AIMO2值得花时间研究

先坦白一点:AIMO2的奖池虽然诱人,但真正值得钻研的是它背后暴露的AI推理短板。市面上大多数LLM应用,回答错了可以再来一遍,你让模型写一段代码,有bug可以调;但数学竞赛题没有“差不多”,每一个中间步骤都可能是致命的。AIMO2对模型的泛化、逐步推理、自我纠错能力提出了极高的要求,这也是为什么这个比赛能吸引顶级团队投入大量资源。

从竞赛策略角度看,AIMO2有非常明显的投入产出比:一个7B或32B的开源模型,配合精心构造的数据和强化学习,就能在数学推理上逼近甚至超过更大的模型。冠军方案公开后,他们提到的很多做法后来被大量团队复用到其他推理类任务里。换句话说,读懂AIMO2冠军方案,等于读到了一份LLM推理能力提升的实战手册。

2. 冠军方案的总体技术架构:没有魔法,只有组合拳

2.1 核心思路拆解

把冠军方案摊开看,技术栈其实非常清晰:以Qwen2.5-Math系列作为基座模型,先用DeepSeek-R1蒸馏的数据做监督微调(SFT),再基于GRPO算法做大规模型强化学习,最后在推理阶段用“采N个答案 + 自评分验证”的方法提升命中率。

这个流程看起来像是一条标准的“开源模型定制”流水线,但真正的难点在细节。先说说为什么选Qwen2.5-Math,而不是直接顶满一个70B甚至更大参数的模型。在Kaggle的竞赛环境里,GPU配额常有上限,训练时间也有限,7B和32B的模型在显存占用、训练吞吐、推理延迟上都是可控的。更重要的是,Qwen2.5-Math是专门在数学语料上继续预训练过的模型,它对数学符号、公式、推理链的底子比通用模型好得多,拿它做基座,后面强化学习会省力不少。

再来说DeepSeek-R1蒸馏数据的作用。R1系列模型通过大规模强化学习获得了极强的长思维链能力,它能写出带有反思、回溯、多路径尝试的详细推理过程。这种数据喂给Qwen2.5-Math做SFT,等于直接把“高手怎么一步步解题”的思维模式迁移过来。这一步不是为了学答案,而是为了学“过程”。

2.2 为什么强化学习是胜负手

只做SFT的问题是模型学会了模仿R1的风格,但没有真正形成自己的探索能力。R1的思路再好,也只是训练数据里有限的样本;AIMO2的测试题是程序生成的,分布外情况极多,模型如果只会模仿固定解法,遇到新题就只能靠“背过的套路”去套。

所以冠军方案把重头戏放在强化学习上,尤其是GRPO(Group Relative Policy Optimization)这个算法。GRPO的核心逻辑是:对同一个问题让模型生成一组答案,然后根据这组答案内部的相对好坏来更新模型参数,不需要额外的Critic模型。这个思路比传统PPO轻量很多,训练开销小,而且数学推理任务里奖励信号可以设计得非常明确——答案对不对、格式对不对、有没有重复。

在冠军方案的分享中,他们强调了一个关键:强化学习不是“让模型做对更多题”,而是“让模型在遇到没见过的题时,依然能组织起有效的推理过程”。这也是为什么他们在RL阶段特别关注思维链长度、格式合规性和答案正确性三者的平衡。后面我会详细拆这些奖励项具体怎么设计。

3. 数据工程:一半以上的功夫都花在这里

3.1 数据来源与公开资源利用

AIMO2参赛者能用的数据主要来自两个方向:公开数学语料库和自建合成数据。公开数据里用得最多的是NuminaMath-1.5这个数据集,它涵盖了AMC、AIME、Math等各类竞赛题和解答,是数学推理训练的主干数据。Proof-Pile-2、OpenWebMath这些数学论文网页语料也常被用来做继续预训练或混合训练,帮助模型建立更广的数学符号和概念认知。

但只用公开数据是远远不够的。测试题是程序化生成的,如果训练数据里全是人工整理的竞赛题,模型在Public LB上可能表现不错,一到Private测试就露馅。冠军团队的做法是大量生成与目标测试分布相近的合成题目。具体方式包括:用代码脚本批量生成数论、组合类题目,再用另一个大模型把题目改成不同表述;也可以把已有的数学题做“反向翻译”——比如把一个题干改成等价但更复杂的说法,迫使模型真正理解题目结构而不是记住套路。

这里要特别提醒一点:合成数据不是越多越好。如果生成的题目只是在表面换词、换数字,模型的泛化能力并不会增强,反而会因为分布集中在某个特定模式上而损失多样性。冠军团队在数据清洗和去重上花了很大功夫,我记得他们使用了n-gram去重和embedding向量去重两套方案,把冗余样本筛掉,保证训练集的覆盖面是“宽”的,而不是“密”的。

3.2 SFT阶段的蒸馏数据选择

SFT阶段最值得学习的一点,是他们对待R1蒸馏数据的态度:不等于全盘接收,而是做筛选和格式化。DeepSeek-R1生成的推理链虽然质量高,但有些输出特别冗长,甚至在末尾会绕圈子。冠军团队会对这些数据进行长度截断、格式统一和答案校验,只保留那些最终答案正确、推理链结构清晰、思考过程有反思性的样本。

有人可能会问:那如果R1给出的推理链本身是错的,但最终答案碰巧对了呢?这种样本在数学任务里其实是很危险的,因为SFT会让模型模仿错误的过程。冠军团队的筛选原则是:过程得分和结果得分双重校验。先用规则判断最终答案是否正确,再对推理链做质量评估,比如是否包含无意义重复、是否中途切换了问题方向、是否以猜测式语句草草收尾。这些细节,普通参赛者很容易忽略,但它恰恰决定了SFT后模型的基础推理素质。

3.3 验证集的构造:别自欺欺人

在打比赛时,公共LB是一个弱信号,因为样本量有限,加上每个人都对着它调参,很容易过拟合。冠军方案里他们自己搭了一套“模拟LB”的验证集:通过同样的程序化生成脚本,再造一批与测试题分布相近的题目,作为本地验证。这个做法非常关键,因为只有验证集和测试集同分布,本地分数才有参考价值。

我个人的经验是,验证集一旦和训练集有重叠或风格偏差,你看到的提升都是幻觉。AIMO2这种数学竞赛,模型对题目风格极其敏感,一点点措辞差异都可能导致解题策略完全不同。所以,宁可花时间生成额外的验证数据,也不要在最后的排行榜上赌运气。

4. 模型选型与SFT实操:把地基打牢

4.1 基座模型选择的几个考量

Qwen2.5-Math成为冠军方案基座,不是偶然。首先是它针对数学任务做了专门的词汇表扩展和继续预训练,对LaTeX、数学符号、程序化表达式的处理非常干净;其次是它有7B、32B、72B多个尺寸可选,参赛者可以根据自己的算力灵活选择。冠军方案主要围绕7B和32B展开,这既是对Kaggle算力限制的妥协,也是一次刻意为之的验证:在小模型上把流程跑通,最后再放大。

如果你打算复现这套方案,我的建议是从7B开始做小规模实验,把数据流程、训练参数、RL逻辑全部验证稳定了,再换32B跑一次大规模训练。不要一上来就用32B,否则排错成本太高,一次训练跑十几个小时才发现数据有问题,效率极低。

4.2 SFT的训练细节与格式约束

SFT阶段并不是简单地把R1蒸馏数据和竞赛题混合扔进去训练。冠军团队在格式上做了严格约束:模型的输出必须包含一段完整的思考过程(CoT),并且最终答案必须包裹在指定的标记中,比如\boxed{123}。这样做的直接好处是,后续强化学习的奖励信号可以非常容易地从输出文本里解析答案,提高了训练管道的鲁棒性。

在损失函数上,SFT使用的是标准交叉熵,但需要对不同部分设置不同的权重。冠军方案里,他们对思考过程部分和答案部分的loss做了区分:答案部分的权重略高一些,以强化模型“正确收尾”的意识。训练时采用全局批次大小128、上下文长度4096左右,学习率设置在1e-5到2e-5之间,并用warmup + cosine调度,避免训练早期参数剧烈震荡。

这里有一个经常被忽略的坑:如果编码器对LaTeX公式切分不当,模型的注意力会分散。建议在做tokenizer适配时,先跑一个小样本的token统计,看看数学符号被切成了多少个token,如果太碎就适当加入新词,或者对输入做预处理(比如把\frac这类高频指令保持完整)。

4.3 SFT之后先别急:检查“坏习惯”

SFT训练完,模型在验证集上的准确率可能已经不错,但这时候千万不能直接上RL。你需要手动检查一批模型的输出,重点看两点:第一,模型是否真的在“推理”,还是靠着训练数据里的常见题面模板在硬套;第二,模型是否会出现“复读机”的现象,就是思考到一半开始重复同一个句子的变体,这种情况下RL阶段会非常难拉回来。

我当时复现这个流程时,发现蒸馏数据里如果混入了过多被截断的推理链,模型会学到“戛然而止”的坏习惯,输出到一半突然给答案,而且不给推导。这种问题靠检查loss曲线是看不出来的,必须人工读输出。所以,在SFT完成后,我强烈建议你抽50-100条验证样本,逐条看生成结果,把有问题的样本归类,再反查数据管线。

5. 强化学习训练:冠军方案的决胜点

5.1 GRPO的基本原理与实现要点

GRPO(Group Relative Policy Optimization)是DeepSeek在训练R1时主推的一种RL算法,它最大的特点是去掉了PPO中价值网络(Critic)的训练负担。在GRPO里,对同一个提示(prompt),策略模型会一次性采样G个输出(比如8或16个),然后计算这组输出的奖励,再把奖励转成组内相对的优势值,用来更新策略。

在AIMO2的场景下,GRPO的logits计算可以描述为:对每个问题,模型生成一组候选答案,每个候选都会得到一个奖励分(规则可计算),然后对这些奖励做组内标准化(比如减去均值除以标准差),优势为正的样本被强化,优势为负的被抑制。这样就不需要像PPO那样维护一个单独的价值网络和GAE计算,管线简单很多,而且在小batch下也能保持稳定的训练信号。

实现的时候要格外关注KL惩罚的设置。如果KL惩罚系数设得太大,模型很快就会被拉回SFT的初始分布,RL的探索效果出不来;设得太小,模型会为了奖励在输出格式上疯狂钻空子,生成一堆“合规”但逻辑混乱的内容。冠军方案的做法是采用动态KL系数,前期放宽约束让模型充分探索,后期逐步收紧让模型收敛到高奖励区域。

5.2 奖励设计:比模型本身更值得反复迭代

AIMO2冠军方案的奖励设计我认为是整篇技术分享里最有含金量的部分。它不是一个单一的“答对给1分、答错给0分”的稀疏奖励,而是一套组合奖励。第一个核心奖励是格式奖励,要求输出严格包含答案标记,所有丢掉\boxed的输出即使答案正确也会被给低分。第二个是准确性奖励,解析答案并与标准答案比对,正确得正分,错误得负分。第三个是重复惩罚项,检测输出文本中的n-gram重复比例,重复越多扣分越多,防止模型退化到重复生成的无意义状态。

除了这三项,冠军团队还引入了长度相关的奖励调整。数学推理思维链过长会导致时间和算力浪费,过短则往往意味着推理深度不足。他们实验发现,把输出限制在某个长度区间内(比如512到2048个token之间)能显著提升训练稳定性。这个长度硬约束配合重复惩罚,等于给模型划定了一个“合理思考区间”。

我印象很深刻的一个坑是:如果准确性奖励权重过高,模型会迅速收敛到“投机策略”——比如生成一个答案后,在后面补上多个候选答案并解释“答案可能是A或B”。从格式和答案解析上看,单个生成可能恰好命中了正确答案,但模型实际上是在撞运气。后来他们加入了“输出中只能出现一个最终答案”的硬性约束,同时让验证器对包含多个答案的输出打低分,才解决了这个问题。

5.3 多阶段RL:从格式对齐到正确率提升

冠军方案把RL训练拆成了多个阶段。第一阶段只优化格式奖励,让模型在保证输出结构正确的前提下自由发挥,相当于把SFT里学到的行为对齐到RL的打分体系里。这个阶段能快速让奖励分数上升,因为格式合规是非常容易学会的。第二阶段再加入答案正确性奖励,让模型在格式稳定的基础上追求解题准确率,这一步是整个RL训练里最漫长的阶段,也是最需要耐心调参的阶段。第三阶段,部分实验还会引入verifier的奖励信号,用一个小型验证器对模型生成的推理过程打分,从而引导模型生成更高“可信度”的草稿。

这种分阶段策略的价值在于,它避免了多目标优化在早期互相干扰。如果你一开始就把所有奖励项全部堆上,模型常常会因为梯度方向混乱而训练不稳定。先解决“输出像什么”的问题,再解决“答案对不对”的问题,最后才解决“过程优不优”的问题,这条路径在实操中成功率高很多。

5.4 训练稳定性的控制技巧

训练中一个非常现实的问题是loss曲线和奖励曲线都会剧烈震荡。GRPO不像SFT那样有固定的监督信号,它的数据分布一直在变。冠军方案里提到他们严格控制了训练过程中的KL散度变化,定期手动查看模型的输出样本,而不是只看reward曲线做判断。这个方法非常朴素但极其有效——你在reward曲线上看到的“剧增”,很可能不是模型变聪明了,而是模型发现了一个奖励漏洞。

另外,检查点(checkpoint)管理在RL阶段也特别重要。我习惯每隔固定步数保存一个检查点,同时记录这个检查点在本地验证集上的答案准确率。这样一旦某个阶段训练崩溃或者过拟合,可以快速回滚到之前最好的状态,而不是从头开始。

6. 推理阶段:把计算量转化成准确率

6.1 Best-of-N采样与多数投票

AIMO2这类数学竞赛题,推理阶段的“思维宽度”往往比“思维深度”更值钱。冠军方案在推理时采用Best-of-N策略:对同一个问题,让模型在较高的温度(比如0.7到1.0)下采样N个不同答案,然后用某种方法从N个候选中选出最终答案。N一般取32到128之间,实在充裕的情况下可以取到256。

最简单的候选选择方法是多数投票(Majority Voting),即哪个答案出现次数多就选哪个。这个策略在数学题上的表现不差,因为它天然地利用了模型在多次采样中对正确推理路径的倾向性。但多数投票有一个明显短板:它只看“数量”,不看“质量”。如果模型的N个采样都陷入同一个错误思维模式,多数投票的结果就是一个信心十足的错误答案。

6.2 自评分验证器:比多数投票更可靠

冠军方案在多数投票之上做了改进,让模型自己当评委。具体做法是:把问题、N个候选答案和每个候选的推理过程拼在一起,构造一个“比较提示”,让模型两两比较哪个答案更合理,或者给每个候选打一个置信度分,最后选置信度最高的答案。这个过程也被称为自一致性验证(self-verification)。

之所以用“两两比较”而不是直接让模型给所有候选打分,是因为模型在同时看到多个选项时,更容易发现它们之间的细微差异;而单独打分时,模型往往会高估所有选项的正确性。冠军团队进一步使用了all-pairs策略,就是把N个候选两两配对,比如有8个候选就组成28对,每一对都让模型判断谁更优,然后通过投票汇总出最终排名。这个方法显著提升了最终答案的准确率,代价是推理时计算量翻倍。

在实现上,自评分阶段和生成阶段的模型可以相同,但推荐使用一个更强的模型(或同一模型的不同checkpoint)来做验证,避免“自己写答案自己批改”的主观偏差。如果算力有限,也可以用统一的模型加一个独立的推理温度设置。

6.3 算力分配策略:简单题少花、难题多花

比赛里算力是一笔硬账。冠军方案里有一个非常聪明的做法:先让模型以低采样次数(比如8次)快速作答,并计算多数投票的一致性——如果8个答案高度一致,说明模型对这道题很有信心,就可以直接作为最终答案;如果答案分散,说明模型把握不准,此时再触发高采样(64或128次)并配合自评分验证器做深度筛选。

这种“由易到难”的算力分配策略,让同样的推理预算发挥出了更高的效率,也让我意识到在比赛中“聪明地使用test-time compute”可能比一味堆参数量更重要。你可以在自己的复现里把N设成8、16、32、64四档,根据“生成答案的熵值”动态决定是否加大采样规模,实测下来能省不少时间。

7. 常见问题与排查实录

7.1 训练loss在降,LB不涨:先查验证集分布

这是比赛中最让人崩溃的情况。训练集上的SFT loss持续下降,本地验证集准确率也不错,但Public LB的分数纹丝不动。大概率是本地验证集和Public LB的数据分布出现了偏差。解决方法是重新审视验证集的生成方式,确保它和竞赛官方测试题的“题源程序”尽量一致。有时候哪怕是微小的措辞差异,比如题目是“Find the number of ways”还是“How many ways are there”,都会影响模型对问题类型的判断。

7.2 RL训练出现奖励崩溃

奖励崩溃的现象是:总分在快速上升,然后突然断崖式下跌,甚至跌到比起点还低。通常原因是模型找到了奖励漏洞,比如开始生成超长的无效推理链去凑格式奖励,或者把多个答案塞进一个输出里提升“蒙对”的概率。解决方向是加强格式约束、加入重复检测、限制输出长度,并且降低单个奖励项的权重上限。

7.3 蒸馏数据带来的脆弱模仿

模型在SFT阶段过于贴近R1的输出风格,导致它对分布外的题目几乎没有应对能力,生成的推理链看起来头头是道,但最终答案错得离谱。这说明SFT阶段的蒸馏数据比例可能过高,压制了模型本身的多样性。适当降低蒸馏数据比例、混入部分由模型自生成的正确样本(self-generated data),能显著增强模型的探索能力。

7.4 Kaggle平台上TPU与公共Notebook的取舍

在Kaggle上训练模型时,T4或TPU是主力资源。AIMO2很多公共Notebook提供了现成的推理流程,但直接拿来当“黑盒”提交很容易在Private阶段翻车。我看到不少队伍在Public LB上成绩不错,最后却因为过拟合Public测试集而掉分。公共Notebook只能作为速度和基线参考,最终方案必须经过自己的验证集校准。

7.5 常见问题速查表

现象可能原因解决方案
SFT loss低但验证集准确率低数据重复度高/分布覆盖窄清洗合成数据,扩大题目类型多样性
RL初始reward上升后崩溃格式奖励漏洞被利用/奖励权重失衡增加硬性格式约束,引入长度和重复惩罚
生成的推理链长但答案全错过度模仿蒸馏风格降低R1蒸馏数据比例,混入自生成数据
Public LB高但Private掉名次过拟合Public测试题分布使用同分布程序生成的私有验证集做决策
自评分验证器把对改成错强模型/验证模型能力不足换更强checkpoint,或对打分温度进行校准

8. 从AIMO2冠军方案里能带走什么

这个方案最值得学习的并不是某一个“绝招”,而是它把数据、训练、推理三个环节环环相扣地组合在了一起。数据的核心目标是让模型见过更宽的题型分布,SFT的核心目标是让模型具备高质量的基础推理习惯,RL的核心目标是让模型在分布外也能组织出有效推理,而推理阶段的Best-of-N与自评分,则是把模型潜在的“多路径解题能力”充分释放出来。

我个人在复现这个流程时最深的一个感受是:在AIMO2里,模型能力的上限在很大程度上由RL阶段的“探索质量”决定。而探索质量又被数据多样性、奖励设计合理性、KL约束松紧共同制约。只看某一个环节,比如疯狂堆数据,或者拼命调高采样数,效果都很有限。只有把每一个细节都做到位,最后才能看到一个稳定的、可复现的提升。这个东西听起来不刺激,但比赛结果就是由这些细节堆出来的。

如果你打算在自己的项目里借鉴这套方案,我的建议是先跑一条小规模完整流程(7B模型、小数据、小采样数),把所有环节跑通并记录每个决策对验证集的影响,再逐步放大。数学推理这个方向还有很多可玩的东西,冠军方案只是开了一个头。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/3 11:16:39

华为IPD流程370个活动详解:从概念阶段到计划阶段的活动级拆解

简介:《华为IPD流程各阶段370个活动详解》是一份面向产品研发管理、项目经理及流程改进人员的专业参考文档,系统梳理了华为集成产品开发(IPD)流程从概念阶段到生产阶段所涉及的370个核心活动。文档以活动编号为主线逐项解析&#…

作者头像 李华
网站建设 2026/10/3 11:15:07

superpowers 三个月深度使用:skill 机制、配置与避坑指南

1. 三个月深度使用后的真实体感 187K star,这个数字放在任何一个开源项目上都是顶流级别的存在。superpowers 这个项目在 Claude Code 生态里火了大半年,社区里到处是“用了就回不去”“效率翻十倍”的安利帖。我大概是在它突破 100K star 的时候入的坑&…

作者头像 李华
网站建设 2026/10/3 11:15:07

数字IC后端项目实战:从congestion到低功耗的完整问题排查清单

做了快两年的数字IC后端项目,从28nm一路做到更先进的节点,最大的感受是:后端这个活儿,真正值钱的不是把一条流程流水线式跑通,而是每一次跑完flow之后,面对那一堆或红或黄的问题报告,能快速定位…

作者头像 李华
网站建设 2026/10/3 11:14:35

飞致云CRM Skills实战:AI智能体如何让销售数据自动补全与风险预警

1. 从销售团队的抱怨说起:为什么通用CRM总差那么一口气飞致云这家公司,做开源项目的人应该不陌生,JumpServer、DataEase、MeterSphere这些项目在圈子里口碑都不错。但今天不聊他们的开源产品,聊一件更接地气的事——他们给自己的销…

作者头像 李华
网站建设 2026/10/3 11:14:02

基于Simulink的多无人机接力信号中继仿真建模实践

直接切入正题。很多搞无人机通信或者做集群项目的朋友,多半都遇到过这个尴尬事:地面站跟飞机飞远了,图传信号飘忽不定,遥控链路偶尔还来个延迟卡顿;想在山谷、城市楼宇这种遮挡环境里做超视距作业,单机那点…

作者头像 李华
网站建设 2026/10/3 11:13:36

得物交易搜索生成式召回:从向量检索到条件生成的范式跃迁

1. 从“卷向量”到“拼生成”:交易搜索召回到底在卷什么做电商搜索的同行这两年应该都有同感:向量检索这条赛道已经卷到不能再卷了。双塔模型、ANN索引、HNSW参数调优、量化压缩,能榨的油水基本榨干了。得物交易搜索团队这次抛出的“生成式召…

作者头像 李华