实时视频风格迁移快速指南:5分钟把摄像头画面变成动画
【免费下载链接】Vision-AgentsOpen Vision Agents by Stream. Build voice and vision agents quickly with any model or video provider. Uses Stream's edge network for ultra-low latency.项目地址: https://gitcode.com/GitHub_Trending/vi/Vision-Agents
想象一下:一场普通的视频会议,你还没开口,摄像头画面已经变成手绘动画。这不是后期渲染,而是 Vision-Agents 提供的实时视频风格迁移。这个视频智能体框架把每一帧送去重绘再发回,你只需几行代码,就能把这套能力装进自己的产品。
先看效果
画面中,摄像头里的人被逐帧重绘成动画角色:衣服、背景连同表情都换成了手绘风,但口型、动作和节奏都没变。对端看到的不是提前录好的素材,而是一条真正在流动的视频流。
它凭什么能做到
关键在哪?把通话的视频通路想成一条传送带:你的摄像头帧顺着带子往前走,RestylingProcessor就是装在带子上的拦截器。它截下原始帧,通过 WebSocket 递给 Decart 的实时重绘接口,再把风格化之后的帧接回来,作为一条新的视频轨道放回传送带,经 Stream 边缘网络发给对端。你只声明"要什么风格",逐帧往返由它代办。
processor = decart.RestylingProcessor( initial_prompt="Studio Ghibli animation style", model="lucy_2_rt", )换个说法:你负责描述画面,模型负责逐帧兑现。因为走的是低延迟边缘网络,对端几乎察觉不到画面是AI重绘的。
跟着做一遍
同步项目依赖
仓库用 uv 管理依赖,一条命令装齐:
uv sync配置两个API密钥
在示例目录建一个.env,填入两家服务的密钥。Decart 负责重绘,Stream 负责音视频传输,缺一不可:
DECART_API_KEY=your_decart_key STREAM_API_KEY=your_stream_key STREAM_API_SECRET=your_stream_secret把处理器挂进Agent
声明好处理器后,放进Agent的processors列表即可,框架会自动接进视频管线:
agent = Agent( edge=getstream.Edge(), llm=openai.LLM(), processors=[processor], )启动第一次通话
在示例目录执行下面的命令,浏览器会自动打开演示界面,点进通话,摄像头画面就是你要的风格了:
uv run decart_example.py run全程不用手写视频管线代码,从装依赖到出效果大约 1 分钟。
进阶玩法
注册函数,让LLM替你换风格
风格不必固定。给 LLM 注册一个函数后,它会自己判断什么时候该换风格——你说"把画面调成雨夜",它就更新提示词,画面随之改变:
@llm.register_function(description="Change the video style") async def change_style(prompt: str) -> str: await processor.update_prompt(prompt) return f"Style changed to: {prompt}"参考图驱动的虚拟试穿
Lucy 这类模型还能吃参考图。update_state会原子地同时替换提示词和图片,画面不会出现半更新的状态,虚拟试穿、换装玩法都靠它。参考图支持文件路径、URL 等格式,详见 plugins/decart/README.md:
await processor.update_state( prompt="A person wearing a superhero costume", image="costumes/superhero.png", )谁适合用
- 电商直播:虚拟试穿的上身效果实时可见,观众边看边下单
- 远程团队:会议画面套一层统一动画滤镜,破冰更快
- 内容创作者:直播自带风格化标签,观众更容易记住你
- 视频App开发者:一个插件就把"AI滤镜"能力接进自家产品
把效果跑起来
git clone https://gitcode.com/GitHub_Trending/vi/Vision-Agents完整可运行的示例在 plugins/decart/example/decart_example.py。摄像头亮起的瞬间,你就已经站在动画里了。
【免费下载链接】Vision-AgentsOpen Vision Agents by Stream. Build voice and vision agents quickly with any model or video provider. Uses Stream's edge network for ultra-low latency.项目地址: https://gitcode.com/GitHub_Trending/vi/Vision-Agents
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考