一、让人抓狂的问题:Claude 真的"会看"视频吗?
不少朋友第一次把一段视频丢给 Claude 想让它总结要点时,都会遭遇同一种"社死"现场:
- 提问:"帮我看看这段 30 分钟的产品发布会,竞品有哪些新功能?"
- 回答:"抱歉,我无法直接处理视频文件,请提供文字描述或截图。"
其实这不怪 Claude —— 它在训练时根本没学过怎么"看"视频。视频对现在的 LLM 来说,就是一堆它完全无法触及的二进制字节。
要让 AI 真正"看懂"一段视频,传统做法只有两条路:
- 手动截屏:把关键画面一张张截图,配文字描述喂给 AI。费力、漏帧、不精准。
- 上传到云端转录服务:把视频发给第三方,等他们把转写+摘要吐回来。慢、贵、隐私让人不放心。
那有没有一种"程序员式"的解法:给我一条命令,让本地机器把视频处理好,直接产出 LLM 能吃的素材?
GitHub 上 1.9k Star 的开源项目 claude-real-video 就是干这事的。它的 PyPI 包名是 crv,作者是独立开发者 Leo Huang。

二、claude-real-video 到底是个啥?一句话讲明白
如果用一句话概括,它的官方描述是:
让 Claude 或任何 LLM 真正"观看"视频 —— 通过场景感知关键帧提取、去重、Whisper 转录,把视频转换为 LLM 可读格式。
翻译成人话:它是一个本地运行的"视频预处理流水线"。给一段视频(YouTube 链接、网盘里下载好的 MP4 都行),它会自动帮你做三件事:
- 挑出关键画面:用场景变化检测,找出"什么时候画面变了",而不是傻乎乎地每秒截一张。
- 干掉重复画面:用三通道 + 滑动窗口算法,把"镜头停了一会儿"或者"画面又切回来"这类冗余帧全部丢掉。
- 听清对白:用 Whisper 给音频做转录,输出带时间戳的文字稿。
最后给你吐出一份 MANIFEST.txt 总览 + 一堆帧图片 + 转录文本,扔给 Claude、Cursor、Codex、Copilot 任何一个 AI,它们都能像"看完视频"一样回答你的问题。
而这一切,只在你自己的电脑上完成,视频不用上传。
三、它是怎么做到的?三个关键技术点讲明白
很多人第一眼看到"关键帧提取"会想:不就是每隔几秒截一张图吗?这有啥技术含量?
还真有。普通截屏方案有三个典型坑,而 claude-real-video 就是为解决这些坑设计的。
1. 智能选帧:场景感知 + 密度下限
想象一部电影里,主角在房间里安静讲了 5 分钟台词,然后突然切到一个赛车追逐场景。
- 普通等距采样:会从台词部分多出几十张几乎一样的图,浪费 token。
- claude-real-video 的做法:通过 ffmpeg 的
select滤镜单遍扫描,只在画面真的发生"场景变化"时才截帧;同时设置一个"每秒至少一帧"的下限,避免快切镜头漏帧。
实测数据(在 Mac mini M4 上跑一段 3 分钟的 640×360 视频):
| 模式 | 抽出的帧数 | 耗时 | 喂给 LLM 的 token |
|---|---|---|---|
| 默认 | 170 帧 | 23.5 秒 | ~52k |
| –max-frames 80 | 80 帧 | 23.4 秒 | ~25k |
| –adaptive(自适应) | 270 帧 | 36.8 秒 | ~83k |
可以看到,帧数和 token 用量完全可控,不会一不小心把百万 token 烧光。
2. 三通道去重:算法里的"小心思"
去重听起来简单,但要让 LLM 既不漏画面、又不被重复帧刷屏,其实是门艺术。这个项目搞了三套去重通道互相补充(不同版本逐步加入):
- 全局像素差异:把帧降采样到 RGB 小图,对比像素差异。粗筛"是不是同一镜头"。
- settled-local 通道(v0.7.4 加入):盯的是画面里的"小动作" —— 字幕滚动、鼠标点击、UI 微调,全局看着差不多但细节在动的情况它能识别。
- action 通道(v0.7.16 加入):专门治"小主体快速动作" —— 比如演讲者手上比划、宠物挠痒痒这类。在 v0.7.16 的更新里,小主体快速动作的保留率从 1/10 提升到了 10/10。
再叠加一个"A-B-A 滑动窗口"机制:镜头从 A 切到 B 又切回 A,它不会傻乎乎地把 A 重复两遍。整套组合拳下来,最后喂给 AI 的帧既不冗余、也不漏重要信息。
3. 诚实转录:Whisper + Silero VAD 双保险
很多人吐槽用 Whisper 转录时,遇到一段纯音乐或静音,它会"幻觉"出几句根本不存在的台词 —— 这是 Whisper 出名的老毛病。
claude-real-video 的解法:
- 配上 Silero VAD(语音活动检测),先告诉 Whisper"这段没人在说话"。
- Whisper 在静音段不会硬编台词,而是老老实实输出"no speech"。
- 这种诚实的转录对后续 LLM 总结尤其重要 —— AI 不会再把幻觉台词当成"视频内容"复述给你。
音频处理的可选包还有两个分支:
[whisper]:默认的 openai-whisper,转录 + 翻译都行。[fast]:换用 faster-whisper,速度更快、内存占用更低,自带 Silero VAD。[speakers]:装上 pyannote 类模型,能区分说话人(A 说/B 说),但要额外下载 45 MB 模型。
四、它适合谁?六个典型场景
聊完技术,估计你想问:这玩意儿到底能干啥?我整理了 6 个真实可用的场景:
- 课程笔记自动化:把 B 站/Coursera 的讲座 URL 扔给 crv,让 Claude 总结成结构化笔记,甚至追问"第 12 分钟讲的是什么公式"。
- 竞品视频分析:下载竞品的产品发布会视频,让 AI 自动抽取每一页 PPT 的关键信息和定价策略。
- 会议录像归档:录好的腾讯会议/Zoom 本地视频,跑一遍后存进知识库(通过
--kb参数指定路径),下次想查"上次会议谁说了什么"直接问 AI。 - 社交媒体素材复盘:把 Instagram Reel、TikTok、YouTube Shorts 的链接丢进去,自动产出摘要。
- 多语言字幕校对:有 .srt/.vtt 字幕时优先用字幕,否则用 Whisper 转录,对翻译人员特别友好。
- AI Agent 工作流前置:配合 Claude Code、Cursor、Codex、Copilot、Gemini CLI 这 50 多个支持 skill 的 agent,让它们具备"读视频"的工具能力。
一句话总结它的目标用户:任何需要让大模型"看"视频、但又不想或不能把视频传到云端的人。
五、怎么装?五步搞定本地部署
部署并不复杂,下面是完整步骤。
步骤 1:装系统依赖 ffmpeg
这一项必须手动装,pip 帮不了你。ffmpeg 是整个流水线干活的"瑞士军刀"。
# macOS
brew install ffmpeg
# Ubuntu / Debian
sudo apt install ffmpeg
# Windows(用 winget 或 choco)
winget install Gyan.FFmpeg
# 或
choco install ffmpeg
装完用 ffmpeg -version 验证一下。
步骤 2:装 Python 包
推荐用虚拟环境,Python 3.10+ 是硬要求。
# 最常用组合:关键帧 + 去重 + Whisper 转录
pip install "claude-real-video[whisper]"
# 只要核心(帧提取 + 去重,不要音频转录)
pip install claude-real-video
# 想要更快 + 防幻觉的转录
pip install "claude-real-video[fast]"
# 想要说话人分离
pip install "claude-real-video[speakers]"
装好后命令行里会多一个 crv 命令。
步骤 3:(可选)让 Claude Code 等 Agent 集成它
这个项目设计了 Skill 安装方式,一行命令就能装到 50+ AI 编辑器:
# 通用方式(Claude Code, Cursor, Codex, Copilot, Gemini CLI 等)
npx skills add HUANGCHIHHUNGLeo/claude-real-video
# Claude Code 插件市场方式
/plugin marketplace add HUANGCHIHHUNGLeo/claude-real-video
/plugin install claude-real-video@claude-real-video
# 手动复制 skill 目录
git clone https://github.com/HUANGCHIHHUNGLeo/claude-real-video.git
mkdir -p ~/.claude/skills
cp -r claude-real-video/skills/claude-real-video ~/.claude/skills/
装完后,你可以在 Claude Code 里直接说"分析这段视频 /path/to/video.mp4″,它就自动调用 crv。
步骤 4:(可选)确认 yt-dlp 能下载你要的视频
如果是 YouTube、Instagram、TikTok 等公开视频,yt-dlp 默认就能下。如果是需要登录的视频(比如私人 YouTube 视频、会员专享内容),可以用 --cookies cookies.txt 指定 Netscape 格式的 cookie 文件,或者 --cookies-from-browser chrome 从浏览器直接读。
注意:cookies 是你自己的账号凭据,使用范围仅限你自己有权观看的视频,请遵守各平台的服务条款。
步骤 5:跑个 Hello World 验证
最简单的验证方式:随便找一个 YouTube 短视频链接跑一下:
crv "https://www.youtube.com/watch?v=xxxxx" -o out --lang en
跑完后看下 out/ 目录:
out/
├── frames/ # 一堆 jpg 关键帧
├── frames.json # 帧时间戳映射
├── transcript.txt # 转录文本(纯文本)
├── transcript.json # 转录(含时间戳,结构化)
├── MANIFEST.txt # 给 LLM 看的总览
└── viewer.html # --viewer 时生成的可视化页面
打开 viewer.html 是个 HTML 浏览器版的时间线 —— 滚动鼠标就能像看视频一样核对 AI 的总结是否对得上。
六、硬件要什么门槛
这个项目的硬件要求相当平易近人,作者主要在 Mac mini M4(Apple Silicon,本地 CPU) 上做基准测试。
| 资源 | 最低 | 推荐 |
|---|---|---|
| 操作系统 | macOS / Linux / Windows 任一 | macOS 或 Linux(脚本支持最好) |
| Python | 3.10+ | 3.11+ |
| 运行内存 | 8 GB | 16 GB |
| 硬盘 | 5 GB 可用(含 Whisper 模型) | 20 GB+ |
| GPU | 不需要(Whisper CPU 也能跑) | Apple Silicon 体验最佳 |
关于 Whisper 模型:默认用的是 base 模型(约 150 MB),速度快但精度一般。如果想要更高的转录精度,可以手动指定 --whisper-model turbo,但是一次性下载约 1.6 GB,运行时要约 6 GB 内存。
不打算本地转录音频、只用 Claude/Gemini 这种云端模型自带的多模态能力?只需要帧提取 + 去重功能的话,几乎不挑机器,几年前的笔记本都能跑。
七、怎么用?常用命令与 Python API 速查
7.1 常用 CLI 场景
# 1. 公开 YouTube/Ins/TikTok 链接
crv "https://www.instagram.com/reel/XXXXX/"
# 2. 本地视频文件
crv lecture.mp4 -o out --lang en
# 3. 只要帧、不要转录(节省时间和磁盘)
crv clip.mp4 --no-transcribe
# 4. 需要登录的视频(自用授权)
crv "https://..." --cookies cookies.txt
# 5. 限制最大帧数 + 网格化预览(节省 token)
crv video.mp4 --max-frames 80 --grid
# 6. 专注模式 v0.3.0+:明确告诉 AI 你想从视频里找什么
crv "https://youtu.be/..." --why "find the pricing strategy" --kb ~/notes
# 7. 启动 Web 界面
crv-web
7.2 Python API(适合嵌入自动化流水线)
from claude_real_video import process
r = process("https://youtu.be/...", "out", lang="en")
print(f"抽出了 {r.frame_count} 帧")
print(f"转录文件:{r.transcript_path}")
返回的对象上有 frame_count、transcript_path 等字段,方便你后续接 LangChain、LlamaIndex 或者自己的 RAG 流水线。
7.3 几个超实用的 flag
--adaptive:自适应采样,画面变化剧烈的视频用它能多抓帧。--text-anchors:把字幕强制对应的画面也带上帧(适合双语字幕校对)。--report:生成report.html,一个可视化报告页。--speakers:开启说话人分离(A 说 / B 说)。--why "<你的目标>":把分析目的直接告知处理流程,影响帧选择策略。--dedup-threshold 8:去重阈值(百分比),调小更激进去重、调大更宽松。
第一次用建议先跑默认参数,对比 --report 生成的可视化页调整阈值。
八、番外篇:crv Pro 付费扩展
如果你用上瘾了,作者还提供了一个 crv Pro 付费扩展(通过 Capafy 或 Lemon Squeezy 购买):
- 限时价格:2026 年 7 月 31 日前 $19,之后恢复 $29。
- 额外能力:
--motion:相机运动分析(识别静态/平移/倾斜/缩放/手持)。--senses:声音情感分析(识别紧张、欢快、悲伤等)。--ai-report:让两个 AI 分别写报告,做交叉验证。--breakdown:镜头语言拆解报告(适合影视分析)。
免费版已经能覆盖 90% 的需求,Pro 更像是给重度视频分析用户的"专业级瑞士军刀"。
九、最后说两句:值不值得入手?
值不值得,取决于你的工作流里"AI 看视频"是不是高频动作。
如果你只是个偶尔看视频的人,截几张图 + 让 Claude 总结确实够用。但如果你:
- 每周要批量处理十几个视频;
- 视频里有大量不变化的演讲/会议/PPT 镜头;
- 对上传到第三方服务的隐私有顾虑;
- 想让 Claude Code、Cursor 这类 Agent 自动化"看视频再写代码/总结"的工作流;
—— 那 claude-real-video 几乎是现成的最佳选择。MIT 许可、纯本地、跟主流 AI 编辑器集成度高,还持续在迭代(0.7.x 系列最近还在加新通道),社区活跃度也在线(1.9k Star、154 Fork)。
给它一条视频链接,一杯咖啡的时间,你就拥有了一个"看得见画面、听得清台词、记得住时间戳"的 AI 视频秘书。