news 2026/8/23 0:06:46

video-analyzer:AI视频分析,把视频转成可编辑的文字说明

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
video-analyzer:AI视频分析,把视频转成可编辑的文字说明

video-analyzer:AI视频分析,把视频转成可编辑的文字说明

【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer

video-analyzer 是一款 AI 视频分析工具,你输入视频,它用视觉模型理解画面、用 Whisper 转写音频,最后输出一份按时间顺序组织的文字描述。结果保存在 JSON 文件里,可直接复制、改写或存档。支持完全本地运行,也可接入云端模型。

先跑什么任务

  • 会议记录:输入会议录像,输出会议内容概述,适合需要整理纪要的团队。
  • 课程教程整理:输入讲课视频,输出按时间推进的画面与讲解描述,适合学生和内容编辑。
  • 素材摘要:输入大量剪辑素材,输出每段视频里发生了什么,适合快速筛片的人。

从 0 到第一次出结果

依赖两项:Python 3.11+ 和 FFmpeg(用于提取音频)。

sudo apt install ffmpeg # macOS 用 brew install ffmpeg git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv && source .venv/bin/activate pip install .

本地跑需要 Ollama,安装后执行ollama pull llama3.2-vision拉取视觉模型;走云端则不需要 Ollama,命令行多传一个模型名即可。

最小运行命令:

video-analyzer demo.mp4

默认走 Ollama 本地模型,结果写入output/目录。

你会拿到什么结果

运行完成后,output/目录下:

output/ ├── analysis.json # 主报告:元数据、转录、逐帧描述、整体摘要 ├── audio.wav # 从视频提取的音轨(中间产物) └── frames/ # 关键帧,默认运行后清理

analysis.json是核心产出,包含四个部分:本次分析用的模型和帧数(metadata)、带时间戳的音频转录(transcript)、每个关键帧的文字描述(frame_analyses)、把全部内容串成时间线的视频总述(video_description)。逐帧描述还带时间戳,方便你定位到具体画面。想看完整结构,可对照示例报告。

按视频长度调整帧参数

帧即从视频中挑出的代表画面。帧多细节全但慢,帧少出结果快但容易漏掉关键动作。命令行上主要用--max-frames(总帧数上限,按整段视频均匀抽样)和--duration(只处理前 N 秒),更细的帧密度frames.per_minuteconfig/config.json里调。

任务场景建议优先调的参数关注结果常见代价
几分钟的短视频--max-frames调大动作细节是否完整本地模型上更慢
几十分钟的会议--max-frames限总量,--duration只处理重点时段完整跑完、转录连贯未处理时段无描述
长讲座、长片降低每分钟帧数,配合--max-frames整体脉络是否对画面细节会丢

本地与云端的取舍

本地:默认客户端就是 Ollama,无需 API 密钥,数据不出机器,适合涉及保密材料的场景。代价是机器要求较高,README 建议至少 16GB 内存,本地跑视觉模型建议 12GB 显存的 GPU 或 32GB 内存的 Apple M 系列。

云端:通过--client openai_api接入任意 OpenAI 兼容接口,通常精度和速度更好,适合对外交付或批量处理:

video-analyzer demo.mp4 \ --client openai_api \ --api-key $API_KEY \ --api-url https://openrouter.ai/api/v1 \ --model gpt-4o

其中$API_KEY只是占位符,换成你从服务商拿到的真实密钥。

结果不满意时先查这里

  1. 视频和音频质量:画面模糊、音轨太弱或有明显噪音都会影响结果;转录不可靠时,工具会跳过音频只做画面分析,日志里有提示。
  2. 帧密度:关键动作被漏掉时,加大--max-frames或调高frames.per_minute
  3. 模型选择:本地模型描述含糊时,换能力更强的云端视觉模型对比一次。
  4. 提示词侧重:用--prompt说明关注点(例如"重点描述人物之间的互动"),语言不明确时可用--language固定转录语言。

继续深入

  • 全部命令行参数和配置项:docs/USAGES.md
  • 三阶段设计的详细说明:docs/DESIGN.md
  • 一份真实的输出报告:docs/sample_analysis.json
  • 默认配置:video_analyzer/config/default_config.json
  • 核心源码:video_analyzer/
  • 提示词自动调优子项目:video-analyzer-tune/

建议先用一段 3 分钟左右的视频按默认设置跑一遍,确认输出结构符合预期后,再回头调--max-frames和提示词。

【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/23 0:03:21

Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改

Anki 批量操作卡片完整指南:一次搞定上千张,不再逐张修改 【免费下载链接】anki Anki is a smart spaced repetition flashcard program 项目地址: https://gitcode.com/GitHub_Trending/an/anki 手上攒了上千张卡片,想统一加个标签、…

作者头像 李华
网站建设 2026/8/22 23:35:30

国内起名师傅靠不靠谱?鲁子翔起名老师分享 6 个实操要点

对于每个家庭而言,宝宝起名是一件庄重且意义深远的事。一个好名字承载着家人的期许、蕴含传统文化底蕴,更会陪伴孩子一生。如今线上起名服务层出不穷,行业质量参差不齐,不少家长容易被虚假宣传、模板化起名、虚高定价误导&#xf…

作者头像 李华
网站建设 2026/8/22 23:33:42

数以轻舟Agent 的 API Key 如何配置?

⚠️ 先分清两个"密钥" 产品激活密钥(买断 license):购买产品后获得,用于激活软件,最多绑定 3 台电脑,离线验证。大模型 API Key:调用 DeepSeek 等云端模型所需的凭证,由模…

作者头像 李华
网站建设 2026/8/22 23:31:40

10秒把NCM解密成MP3:ncmdump免费一键转换网易云音乐

10秒把NCM解密成MP3:ncmdump免费一键转换网易云音乐 【免费下载链接】ncmdump 项目地址: https://gitcode.com/gh_mirrors/ncmd/ncmdump ncmdump 是一个把网易云音乐的 NCM 格式文件还原回标准 MP3 的免费小工具。这篇文直接走流程:先用一条命令…

作者头像 李华
网站建设 2026/8/22 23:30:36

第九篇:Ktor Plugin 实战:Logging、HttpTimeout 与 HttpRequestRetry

前面几篇,我已经把 Ktor 网络层逐渐搭到了这里:ApiService↓ NetworkClient↓ NetworkConnectivityProvider↓ Pre-check↓ HttpClient↓ Engine↓ HTTP同时也建立了异常体系:Network Timeout HTTP Parse Business Unknown↓ ExceptionMapper…

作者头像 李华