一、这个项目是什么?
bradautomates/claude-video 的 Slogan 是:「Give Claude the ability to watch any video.」
这个项目解决了一个很具体但长期被忽视的问题:Claude 能读代码、读文档、读网页,唯独看不了视频。一个 AI 编程助手,看不见教程视频的内容,等于永远缺了一块。
claude-video 通过一个 /watch 命令,把视频的下载、画面提取、语音转文字三条管线合并成一条自动化流水线,将带时间戳的文字稿和缩放帧画面直接发给 Claude。当 AI 给出回答时,它其实已经完整过了一遍画面和音轨。
二、这个项目适合哪些人?
- AI 学习者:想用 Claude 分析 YouTube 教程、B 站课程、学术演讲内容的人
- 技术内容创作者:需要把视频教程转写成博客文章、图文教程、文档笔记
- Claude Code 重度用户:想让 AI 在写代码之前先「看完」相关视频教程
- 研究工作者:需要快速提取视频中的关键信息、生成摘要、提取代码示例
- 开发团队:想把内部培训视频、会议录像转化为可检索的知识库
三、核心能力:一条命令让 Claude 看视频
最核心的 /watch 命令
用户只需要在 Claude Code(或支持的 Agent)中输入:
/watch <YouTube URL 或本地文件路径>
Claude-video 会自动完成以下全流程:
- 视频下载:如果是 YouTube 或其他在线视频,使用 yt-dlp 自动下载
- 画面提取:按设定的缩放帧率从视频中提取关键画面
- 语音转写:使用 Whisper 模型将音频转为带时间戳的文字稿
- 内容注入:将文字稿和画面一起发给 Claude,附带时间戳信息
- Claude 分析:Claude 获得完整的视频上下文后,可以回答问题、总结内容、提取代码、写教程
零配置启动
claude-video 最大的优点之一是「零配置」:yt-dlp 和 ffmpeg 会自动安装,用户不需要手动配置任何环境变量或依赖路径。
支持的输入类型
- YouTube 链接:直接粘贴 YouTube 视频 URL,自动下载分析
- 其他在线视频平台:yt-dlp 支持的平台均可(via yt-dlp)
- 本地视频文件:直接传入本地路径,跳过下载步骤
四、技术架构解析
依赖工具链
- yt-dlp:视频下载,支持 YouTube 及 1700+ 视频平台
- ffmpeg:视频帧提取、音频分离与格式转换
- Whisper:OpenAI 开源的语音识别模型,将音轨转为文字稿
Claude Code Skill 安装机制
项目提供了多种安装方式,覆盖主流 Agent 平台:
Claude Code(推荐方式)
# 添加 marketplace 并安装 /plugin marketplace add bradautomates/claude-video /plugin install watch@claude-video
Claude Code 的 marketplace 机制支持自动更新,装完后 Claude Code 会自动同步最新版本。
npx 方式(全局安装)
npx skills add bradautomates/claude-video -g
-g 参数表示全局安装,对当前用户全局可用,所有项目都可以调用。
其他 Agent 平台
仓库文档中还列出了 claude.ai web 版本和手动安装的步骤,覆盖 Codex、OpenClaw、Cursor 等主流 AI Agent。另有 .claude-plugin 和 .codex-plugin 目录,说明项目在多平台支持上做了预研。
五、实际使用场景
场景一:把 YouTube 教程变成博客文章
传统流程:看视频 → 暂停 → 记笔记 → 关掉视频 → 写博客。
claude-video 流程:/watch <URL> → Claude 看完 → 「帮我把这期视频写成一篇图文教程博客」→ 直接拿博客草稿。
场景二:让 AI 先「看完」再写代码
Claude Code 在写代码之前,往往需要先理解一个项目的技术背景。很多时候最好的参考资料是一期 B 站或 YouTube 的技术演讲视频。/watch 之后,Claude 对这个技术的理解就建立在「实际看过」的基础上,而不是靠猜测。
场景三:快速提取视频中的代码示例
教程视频中经常会有大量代码展示。用 claude-video 处理后,Claude 收到的文字稿有时间戳,可以精准告诉用户「这段代码出现在 12:34」,并直接提取出来供用户使用。
场景四:视频内容摘要与问答
对于长视频(如 1-2 小时的学术演讲),可以直接问 Claude:「这期视频的核心论点是什么?」「有哪些关键数据?」Claude 因为已经「看过」视频,回答基于真实画面和字幕,而不是训练数据。
六、仓库结构与多平台支持
目录结构
- skills/watch/:核心 Skill 定义文件
- .claude-plugin/:Claude Code 插件格式
- .codex-plugin/:Codex 插件格式
- hooks/:钩子脚本
- dev-sync.sh:开发同步脚本
- CHANGELOG.md:版本变更记录
- CLAUDE.md:Claude 项目规范
多平台兼容
项目明确支持 Claude Code、Codex、OpenClaw、Cursor 等多个主流 AI Agent 平台,跨平台兼容性做得比较完善。
七、同类项目对比
vs video-use(browser-use 团队)
video-use 的定位是「对话式视频剪辑」,把原始素材扔进文件夹,用自然语言告诉 Claude Code 想要什么,直接拿回剪辑好的 final.mp4。它的核心是剪辑,适合做视频内容的人。
claude-video 的核心是「理解和分析」,目的是让 AI 获得视频信息来做后续处理(如写教程、摘要、问答),不输出视频剪辑结果。
两者互补:video-use 负责拍,claude-video 负责看。
vs happy-claude-skills 的 video-processor
happy-claude-skills 是一个综合技能合集,其中包含 video-processor,能力与 claude-video 有重叠:视频下载、音频提取、格式转换、Whisper 转写。
区别在于:video-processor 是技能合集中的一部分,claude-video 是独立项目,专注「让 AI 看懂视频」这一件事,更轻量、更聚焦。
vs 传统视频转文字工具
传统工具(剪映、Whisper CLI 等)只做转写,输出纯文本或 SRT 字幕文件,无法让 AI 直接「拥有」视频的理解能力。claude-video 在 Whisper 转写的基础上,增加了帧提取和时间戳注入,让 Claude 获得的是有时间维度的完整视频上下文。
八、局限与注意事项
- 依赖本地环境:需要本地安装 yt-dlp、ffmpeg 和 Whisper(ffmpeg 和 yt-dlp 自动安装,但 Whisper 模型需要额外配置)
- 长视频成本:视频越长,帧提取越多,Whisper 转写耗时越长,发给 Claude 的上下文 token 越多,成本越高
- 帧率选择:缩放帧率设置影响 Claude 收到的画面数量——太低可能遗漏细节,太高会增加上下文负担
- 项目活跃度:目前 11 次 commit,项目较新,功能完善度仍有提升空间
- 非视频剪辑工具:这个项目不生成视频,适合「看视频 + 理解」场景,不适合「剪视频」场景
九、总结
claude-video 解决了一个看似小但实际很关键的痛点:AI 看见文字、看见代码,但看不见视频。这个短板在 AI 编程助手的使用场景中尤其明显——最好的教程往往是视频,但 AI 偏偏看不了视频。
claude-video 的设计思路很务实:不重新发明轮子,用 yt-dlp 解决下载、ffmpeg 解决帧提取、Whisper 解决转写,三条成熟管线拼在一起,最后把结果交给 Claude 处理。最难得的是零配置体验,Claude Code marketplace 的自动更新机制也保证了用户总是用到最新版本。
它不追求功能的大而全,只做好一件事——「让 Claude 真正看懂视频」。在这个定位上,目前同类项目中它的体验是最顺畅的。
