一文读懂claude-video:从粘贴URL到Claude'看完'视频的完整旅程
【免费下载链接】claude-videoGive Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-video
claude-video是一个开源技能(Skill),让 Claude 拥有"看视频"的能力:粘贴一个视频 URL 或本地文件,/watch命令会自动完成下载、抽帧、字幕/语音转写,并把每一帧画面和逐句字幕交给 Claude——等它回答时,它是真的"看过"这个视频的。
一、它解决什么问题?
🤔 以前你给 Claude 一个 YouTube 链接,它只能靠标题猜测,或者拿到一份缺少画面信息的文字稿。画面里发生了什么(界面长什么样、某一刻弹出了什么错误),它一概不知。
claude-video补上了这个缺口,把"视频"变成 Claude 能直接消费的输入。典型用法有三个:
- 📊拆解别人的内容:粘贴一个爆款视频,问它"开场用了什么钩子?"——Claude 会看前几帧画面、读开头字幕,帮你分析结构;
- 🐛从录屏中定位 bug:把同事发来的报错录屏丢给它,问"哪里出了问题?",它能找到问题出现的那一帧并描述画面;
- ✂️快速总结视频:20 分钟的长视频不值得看完,
/watch一句话让它给出结构、重点时刻和实际讲到的内容,比 2 倍速快得多。
二、三种安装方式,总有一款适合你
| 使用环境 | 安装方式 |
|---|---|
| Claude Code | /plugin marketplace add bradautomates/claude-video,然后/plugin install watch@claude-video |
| claude.ai(网页版) | 下载watch.skill文件,在 设置 → Capabilities → Skills 中导入 |
| 手动安装 / Codex | git clone https://gitcode.com/GitHub_Trending/cl/claude-video ~/.claude/skills/watch |
💡 零配置起步:首次运行时会自动通过 brew 安装yt-dlp和ffmpeg(macOS 自动执行,Linux/Windows 会打印精确命令)。只要视频平台本身有字幕,全程免费,连 API Key 都不用配。
三、上手体验:一条命令开始"看视频"
装好后,在对话里直接输入:
/watch https://youtu.be/dQw4w9WgXcQ what happens at the 30 second mark?还支持本地文件和"聚焦片段":
/watch ~/Movies/screen-recording.mp4 when does the UI break? /watch https://youtu.be/abc --start 2:15 --end 2:45支持 YouTube、Vimeo、TikTok、X、Instagram 等 yt-dlp 能下载的任何公开视频,以及.mp4、.mov、.mkv、.webm等本地格式。
四、幕后流程:从 URL 到"看完"的 5 步流水线
🔍 整个流程由 watch 技能契约 定义,入口是scripts/watch.py,各步骤分工明确:
- 预检环境:
scripts/setup.py做一次不到 100 毫秒的检查,确认ffmpeg/yt-dlp就绪,缺失时引导安装; - 下载视频:
scripts/download.py调用 yt-dlp 把视频拉到临时工作目录,同时顺手抓取原生字幕(VTT 格式); - 自动抽帧:
scripts/frames.py用 ffmpeg 按"时长自适应帧率"把视频切成 JPEG 帧,每帧带t=MM:SS时间戳标记; - 获取逐句字幕:
scripts/transcribe.py优先使用平台原生字幕(免费、快);没有字幕时,scripts/whisper.py把音频发给 Whisper API(Groq 优先,OpenAI 兜底)做语音转写; - 逐帧阅读并回答:Claude 并行读取每一帧图片,配合带时间戳的字幕回答你的问题——答案基于它"真正看到"的画面和"听到"的台词,而非标题猜测。用完之后临时目录会被清理。
五、帧预算策略:为什么长视频不建议"一口气看完"
🎞️ 图片是最耗 token 的部分,所以脚本按视频时长自动分配帧数,而不是固定抽帧率:
| 视频时长 | 默认帧预算 | 体验 |
|---|---|---|
| ≤ 30 秒 | 约 30 帧 | 密集,几乎覆盖每个关键时刻 |
| 30 秒 – 1 分钟 | 约 40 帧 | 依然密集 |
| 1 – 3 分钟 | 约 60 帧 | 舒适 |
| 3 – 10 分钟 | 约 80 帧 | 稀疏但可用 |
| > 10 分钟 | 100 帧(上限) | 触发"sparse scan"提醒 |
当问题指向某个片段("2:30 左右发生了什么"、"最后 30 秒")时,加上--start/--end进入聚焦模式——单位时间帧数更密(上限 2 fps),比全片稀疏扫一遍有用得多,token 消耗也更低。
六、成本与费用控制
💰 费用结构非常友好:
- 下载 + 原生字幕:只要
yt-dlp+ffmpeg,完全免费,覆盖大多数公开视频; - Whisper 兜底:仅当视频没有字幕轨道时才触发(本地文件、部分 TikTok/Vimeo 等),推荐 Groq 的
whisper-large-v3(更便宜更快),Key 存放在~/.config/watch/.env; - 彻底关闭转写:加
--no-whisper,无字幕的视频只返回画面帧,零 API 费用。
其他实用参数:--max-frames N收紧帧数上限、--resolution 1024提升分辨率以便读屏上文字(PPT、代码截图场景)、--fps F手动覆盖抽帧率。
七、实用技巧与已知限制
⚡ 几条帮你少走弯路:
- 10 分钟以内效果最佳;更长的视频建议直接用
--start/--end聚焦你关心的片段; - 硬性上限:2 fps、100 帧,脚本强制生效,不用担心上下文被撑爆;
- Whisper 上传上限 25 MB(约 50 分钟音频),超长视频请靠字幕或聚焦区间;
- 不支持需要登录的平台:技能不持有任何账号凭据,yt-dlp 下载不了的,它也看不了;
- Windows 用户注意:脚本要用
python而不是python3调用(后者是商店占位程序)。
八、快速开始清单 ✅
- 选一种方式安装(推荐 Claude Code 插件,两条命令搞定);
- 首次运行
/watch自动完成依赖预检与安装; - 粘贴 URL 或本地路径 + 你的问题,坐等 Claude"看完"作答;
- 长视频记得用
--start/--end聚焦片段,省 token 又精准。
claude-video的代码结构非常清晰:scripts/watch.py是编排入口,download.py/frames.py/transcribe.py/whisper.py各司其职,setup.py负责环境预检,项目采用 MIT 协议开源,欢迎阅读源码深入理解这套"让 AI 看视频"的流水线。
【免费下载链接】claude-videoGive Claude the ability to watch any video. /watch downloads, extracts frames, transcribes, hands it all to Claude.项目地址: https://gitcode.com/GitHub_Trending/cl/claude-video
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考