news 2026/9/12 6:38:14

机器学习论文每周精选怎么追:ML-Papers-of-the-Week 入门

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
机器学习论文每周精选怎么追:ML-Papers-of-the-Week 入门

机器学习论文每周精选怎么追:ML-Papers-of-the-Week 入门

【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week

ML-Papers-of-the-Week 是 DAIR.AI 维护的机器学习论文每周精选仓库,每周从 arXiv 等渠道挑出计算机视觉、深度学习等方向最值得读的论文,整理成一张带论文链接的清单。刷 arXiv 花不完的时间交给它来筛,你只需要读被留下的那几篇。下面依次说清项目在做什么、哪几篇 CV 论文值得先读,以及怎么把它变成自己的每周追更入口。

这个项目在做什么

DAIR.AI 的团队自己读 AI 论文读不赢,干脆把每周的筛选结果公开成仓库,按周、按年归档。机制不复杂:每周一更,把当周入选的论文用"编号 + 一句话结论 + 若干要点 + 论文链接"的表格列出,再往years/目录里对应年份的文件追加,比如years/2025.md就收齐了 2025 全年每一周的周榜。判断一篇论文值不值得读之前,你先到这里看看它有没有上榜就够了。

图:仓库里周榜的配图多为论文原始架构图,如上例中的世界模型 DreamerV3 与扩散模型示意,读机器学习论文每周精选时可直接对照原文。

本期值得读的论文

下面从years/2025.md里挑三篇计算机视觉方向的,分别落在分割、视频生成、3D 重建三个子方向,适合先建立整体感觉。

SAM 3:给个短语就能分割目标

一句话结论:给一个名词短语(比如"戴红帽子的人")当提示,它就能在图像和视频里找到并框出对应目标。

它解决的问题:传统分割往往要先框再填像素,SAM 3 直接吃概念化提示(Promptable Concept Segmentation,按语义描述来定位对象),靠 400 万概念标签的数据管线训练,在图像与视频分割上的性能约为先前方法的两倍,并随模型放开了权重。

对初学者意味着什么:这是把"分割"从框出对象推进到按语义找对象的代表,读它比从零啃原始论文更容易建立对基础分割模型的直觉。

STARFlow-V:视频生成不必只靠扩散

一句话结论:Apple 用 7B 参数的归一化流(normalizing flow,一类能反向求解的生成模型)做出了和扩散模型能打的视频生成器。

它解决的问题:扩散模型是当下视频生成的主流,但采样步骤多、偏慢。STARFlow-V 用全局-局部架构配合"视频感知的 Jacobi 迭代"做并行采样,能出 480p、16fps 的视频,并原生支持文生视频、图生视频、视频到视频。

对初学者意味着什么:它是个好例子,说明"生成"这条线上扩散并非唯一答案;理解归一化流这类替代路线,读视频生成论文时就不会只盯着一个框架。

图:提示词优化驱动图像生成的实验截图,属计算机视觉方向每周精选论文的常见产出形式。

SHARP:一张照片拍出周边视角

一句话结论:一张照片、一张普通 GPU、不到一秒,给出该物体的三维高斯表示(3D Gaussian Splatting,把场景存成大量带颜色的小球以便快速渲染),就能实时渲染出附近的观看角度。

它解决的问题:新视角合成(novel view synthesis)过去要么慢,要么要环拍很多张。SHARP 用一次前向推理直接出 3D 高斯表示,LPIPS(感知相似度指标)比先前方法低 25%–34%,速度快了三个数量级,还带零样本泛化。

对初学者意味着什么:3D 重建与神经渲染里"又快又好"是长期痛点,这篇用具体数字告诉你前馈式方法现在能做到什么程度。

图:由单张照片推导出周边视角的 3D 场景重建结果,是计算机视觉论文里神经渲染方向的典型展示。

3 步把项目用起来

  1. 克隆到本地:
git clone https://gitcode.com/GitHub_Trending/ml/ML-Papers-of-the-Week
  1. 按周定位:打开years/2026.md(最新)或years/2025.md,文件顶部就是最新一周的十篇论文表格,往下翻即往更早的周;SUMMARY.md则给出整个仓库的目录总览。
  2. 用数据视图核对:research/ml-potw-10232023.csv把历史精选汇总成一张表,方便你自己加筛选;pics/里存着各周论文的原始配图,读论文时对照着看更直观。

下一步读什么

  • 追最新:每周固定看years/2026.md顶部新增的那一周,把入选的视觉论文记进自己的清单,读得动就展开读原文。
  • 顺藤摸瓜:从 SAM 3 往下追概念分割,从 STARFlow-V 往下追归一化流与视频生成,从 SHARP 往下追 3D 高斯表示,一个子方向读透再换。
  • 自己做索引:把research/ml-potw-10232023.csv复制到本地,加"是否已读 / 领域标签"两列,几周后就会有一份专属于你的计算机视觉论文台账。

每周十分钟,把别人筛好的论文读进自己的库里,比刷一整天的信息流更划算。

【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/12 6:36:51

网页视频下载完整指南:猫抓嗅探扩展替你做的 4 件事

网页视频下载完整指南:猫抓嗅探扩展替你做的 4 件事 【免费下载链接】cat-catch 猫抓 浏览器资源嗅探扩展 / cat-catch Browser Resource Sniffing Extension 项目地址: https://gitcode.com/GitHub_Trending/ca/cat-catch 课程到期前想把视频留存在本地、直…

作者头像 李华
网站建设 2026/9/12 6:36:03

HyperFrame:视频时序信息的高效中间表示与工程实践

HyperFrame 这个词,最近在视频处理和动态三维重建的圈子里热度一直在涨。不少刚接触的人以为它是某个新算法的名字,其实它更像是一种处理视频时序信息的中间表示方式:把一小段时间窗口内的若干帧,通过某种方式“压”成一个可供模型…

作者头像 李华
网站建设 2026/9/12 6:34:48

OpenCV仍是多模态视觉开发基本功:从预处理到Agent落地

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 6:31:53

SpringMVC大文件分块上传优化实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/12 6:31:45

PaddlePaddle 源码工程审阅:从算子实现到内存管理的架构实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华