接着上篇的节奏,继续阿里巴巴的操作技能泛化工程师。上一讲埋的伏笔,正好借少样本学习展开。
少样本学习:这题没有标准答案,只有工程答案
阿里巴巴面试官聊少样本学习时,喜欢把条件一步步收紧,看候选人在极端场景下的工程判断。
面试官抛出的第一个问题是:“跨物体/跨场景泛化,VLA怎么处理没见过的全新SKU?”
核心答案:依赖开放词汇视觉+语言条件:物体以CLIP文本/图像特征作条件而非固定类别id,新SKU只需语言描述或一张参考图即可零样本指代。操作层面用原子技能组合(抓-移-转-放)而非端到端记物体,新物体靠几何抓取点估计(GraspNet式)生成6D位姿。我们实测未见SKU首抓成功率约70%,5条示教微调后到90%。
面试官让把关键逻辑落到代码上,可以写成:
def grasp_new(query_img_or_text, vla): cond = vla.encode_condition(query_img_or_text) # 开放词汇特征 pose = vla.predict_grasp(cond) # 6D抓取位姿 return pose面试官把问题推进一步:“全新透明/反光物体视觉特征弱,零样本抓不准怎么办?”
叠加主动感知:多角度补光+多视角投票提升位姿估计,并用触觉接触探索