news 2026/9/6 13:47:32

谷歌微软All in多模态!

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
谷歌微软All in多模态!

多模态可以说是当下最火的领域之一,CV和NLP都在积极拥抱它,VLM和3D文生图更是当红辣子鸡。尤为值得一提的是,其任务场景非常广泛、故事性强、且缺乏统一的理论框架,可发论文的着手点很多,创新空间广阔,非常推荐想快速出成果的伙伴多关注。

为让大家能够紧跟领域前沿,找到更多idea启发。我给大家对领域内的代表性文章进行了梳理,共330篇,原文和源码都有!主要涉及核心方法与技术、模型架构与训练范式、垂直领域应用、学习场景与挑战等4大方面。

扫描下方二维码,回复「多模态197」

免费获取全部论文合集及项目代码

核心方法与技术

主要聚焦多模态对齐、多模态融合等核心技术的算法、模块

TouchFormer: A Robust Transformer-based Framework for Multimodal Material Perception

内容:这篇论文提出了TouchFormer框架,这是一个基于Transformer的鲁棒多模态材料感知框架,专门用于在视觉受限或嘈杂环境下进行材料分类。该框架通过模态自适应门控机制、跨模态注意力机制和跨实例嵌入正则化策略,能够动态整合触觉、听觉等多种传感器信息,在材料分类任务中显著优于现有方法,并在模拟火灾等极端环境下的机器人实验中验证了其实用性。

AlignMamba: Enhancing Multimodal Mamba with Local and Global Cross-modal Alignment

内容:这篇论文提出了AlignMamba框架,通过结合最优传输(OT)的局部token级对齐和最大均值差异(MMD)的全局分布级对齐,增强了Mamba架构在多模态融合中的跨模态关系建模能力,在保持线性计算复杂度的同时显著提升了融合效果,在完整和不完整多模态任务中均达到最先进性能,同时大幅降低GPU内存使用和推理时间。

模型架构与训练范式

主要是模型的宏观、规模以及训练的策略和方法,包括多模态大模型、多模态预训练……

Notes-guided MLLM Reasoning: Enhancing MLLM with Knowledge and Visual Notes for Visual Question Answering

内容:这篇论文提出NoteMR框架,通过让MLLM先基于检索到的外部知识生成"知识笔记"过滤噪声并激活正确隐式知识,再用知识笔记与原图计算跨模态注意力得到聚焦关键区域的"视觉笔记",最后把两种笔记连同原图和问题一起输入MLLM并辅以候选答案重排,显著提升知识型VQA性能,在OK-VQA和A-OKVQA上分别超过SOTA 5.31%和3.4%,有效缓解幻觉并增强细粒度感知。

扫描下方二维码,回复「多模态197」

免费获取全部论文合集及项目代码

垂直领域应用

主要涉及医学图像、情感分析、目标检测、遥感、多模态生成……

BSAFusion: A Bidirectional Stepwise Feature Alignment Network for Unaligned Medical Image Fusion

内容:这篇论文提出BSAFusion框架,通过无模态差异特征表示(MDF-FR)减少跨模态匹配差异,并采用双向逐步特征对齐与融合(BSFA-F)策略,在统一网络中同时完成非对齐多模态医学图像的配准与融合,显著提升了非对齐医学图像融合任务的性能。

学习场景与挑战

主要是数据或任务受限等特定挑战下的学习范式,涉及小样本学习、迁移学习

Connecting Giants: Synergistic Knowledge Transfer of Large Multimodal Models for Few-Shot Learning

内容:这篇论文提出SYNTRANS框架,通过“视觉知识蒸馏+协同语义挖掘+双向视觉-语义桥接”三阶段,把CLIP、大语言模型和视觉-语言模型中的显式与隐式知识转化为类别特异分类器权重,并与小样本视觉原型自适应融合,在4个FSL基准上仅用一个轻量编码器就显著超越现有SOTA,实现大模型知识向小样本学习者的协同迁移。

扫描下方二维码,回复「多模态197」

免费获取全部论文合集及项目代码

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 2:33:20

ImageGPT-Large:如何用GPT技术进行像素级图像生成?

ImageGPT-Large:如何用GPT技术进行像素级图像生成? 【免费下载链接】imagegpt-large 项目地址: https://ai.gitcode.com/hf_mirrors/openai/imagegpt-large 导语 OpenAI推出的ImageGPT-Large模型开创性地将GPT架构从文本领域拓展至图像生成&…

作者头像 李华
网站建设 2026/9/3 8:39:13

星火应用商店:让Linux软件安装像手机应用一样简单

星火应用商店:让Linux软件安装像手机应用一样简单 【免费下载链接】星火应用商店Spark-Store 星火应用商店是国内知名的linux应用分发平台,为中国linux桌面生态贡献力量 项目地址: https://gitcode.com/spark-store-project/spark-store 还在为Li…

作者头像 李华
网站建设 2026/9/2 21:50:56

10个必备Flutter开发免费资源:从零开始构建跨平台应用

10个必备Flutter开发免费资源:从零开始构建跨平台应用 【免费下载链接】free-for-dev free-for-dev - 一个列出了对开发者和开源作者提供免费服务的软件和资源的集合,帮助开发者节省成本。 项目地址: https://gitcode.com/GitHub_Trending/fr/free-for…

作者头像 李华
网站建设 2026/8/21 17:19:35

如何快速掌握InstantID:新手也能上手的完整部署指南

如何快速掌握InstantID:新手也能上手的完整部署指南 【免费下载链接】InstantID 项目地址: https://gitcode.com/gh_mirrors/in/InstantID 你是否曾经为生成个性化AI图像而苦恼?想要保留特定人物的身份特征,却苦于复杂的模型训练过程…

作者头像 李华
网站建设 2026/9/3 13:40:29

Ray-MMD终极完整教程:从零开始掌握3D动画渲染

Ray-MMD终极完整教程:从零开始掌握3D动画渲染 【免费下载链接】ray-mmd 🎨 The project is designed to create a physically-based rendering at mikumikudance. 项目地址: https://gitcode.com/gh_mirrors/ra/ray-mmd Ray-MMD是一个强大的开源渲…

作者头像 李华
网站建设 2026/9/4 15:29:59

I2C开发板实操教程:基于STM32的入门应用

手把手教你玩转STM32上的I2C通信:从协议到实战,零死角解析你有没有遇到过这样的场景?接好了一个温湿度传感器,代码也写了,可就是读不出数据——要么全是0xFF,要么总线直接“锁死”。反复检查线路、地址、上…

作者头像 李华