claude-video:让 Claude 真正「看懂」视频,AI Agent 多模态能力的最后一块短板

claude-video:让 Claude 真正「看懂」视频,AI Agent 多模态能力的最后一块短板最新版

官方版无广告8

更新日期:2026年7月23日分类标签: 语言:中文平台:没限制

0 人已下载 手机查看

一、这个项目是什么?

bradautomates/claude-video 的 Slogan 是:「Give Claude the ability to watch any video.」

这个项目解决了一个很具体但长期被忽视的问题:Claude 能读代码、读文档、读网页,唯独看不了视频。一个 AI 编程助手,看不见教程视频的内容,等于永远缺了一块。

claude-video 通过一个 /watch 命令,把视频的下载、画面提取、语音转文字三条管线合并成一条自动化流水线,将带时间戳的文字稿和缩放帧画面直接发给 Claude。当 AI 给出回答时,它其实已经完整过了一遍画面和音轨。

二、这个项目适合哪些人?

  • AI 学习者:想用 Claude 分析 YouTube 教程、B 站课程、学术演讲内容的人
  • 技术内容创作者:需要把视频教程转写成博客文章、图文教程、文档笔记
  • Claude Code 重度用户:想让 AI 在写代码之前先「看完」相关视频教程
  • 研究工作者:需要快速提取视频中的关键信息、生成摘要、提取代码示例
  • 开发团队:想把内部培训视频、会议录像转化为可检索的知识库

三、核心能力:一条命令让 Claude 看视频

最核心的 /watch 命令

用户只需要在 Claude Code(或支持的 Agent)中输入:

/watch <YouTube URL 或本地文件路径>

Claude-video 会自动完成以下全流程:

  1. 视频下载:如果是 YouTube 或其他在线视频,使用 yt-dlp 自动下载
  2. 画面提取:按设定的缩放帧率从视频中提取关键画面
  3. 语音转写:使用 Whisper 模型将音频转为带时间戳的文字稿
  4. 内容注入:将文字稿和画面一起发给 Claude,附带时间戳信息
  5. Claude 分析:Claude 获得完整的视频上下文后,可以回答问题、总结内容、提取代码、写教程

零配置启动

claude-video 最大的优点之一是「零配置」:yt-dlp 和 ffmpeg 会自动安装,用户不需要手动配置任何环境变量或依赖路径。

支持的输入类型

  • YouTube 链接:直接粘贴 YouTube 视频 URL,自动下载分析
  • 其他在线视频平台:yt-dlp 支持的平台均可(via yt-dlp)
  • 本地视频文件:直接传入本地路径,跳过下载步骤

四、技术架构解析

依赖工具链

  • yt-dlp:视频下载,支持 YouTube 及 1700+ 视频平台
  • ffmpeg:视频帧提取、音频分离与格式转换
  • Whisper:OpenAI 开源的语音识别模型,将音轨转为文字稿

Claude Code Skill 安装机制

项目提供了多种安装方式,覆盖主流 Agent 平台:

Claude Code(推荐方式)

# 添加 marketplace 并安装
/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

Claude Code 的 marketplace 机制支持自动更新,装完后 Claude Code 会自动同步最新版本。

npx 方式(全局安装)

npx skills add bradautomates/claude-video -g

-g 参数表示全局安装,对当前用户全局可用,所有项目都可以调用。

其他 Agent 平台

仓库文档中还列出了 claude.ai web 版本和手动安装的步骤,覆盖 Codex、OpenClaw、Cursor 等主流 AI Agent。另有 .claude-plugin.codex-plugin 目录,说明项目在多平台支持上做了预研。

五、实际使用场景

场景一:把 YouTube 教程变成博客文章

传统流程:看视频 → 暂停 → 记笔记 → 关掉视频 → 写博客。
claude-video 流程:/watch <URL> → Claude 看完 → 「帮我把这期视频写成一篇图文教程博客」→ 直接拿博客草稿。

场景二:让 AI 先「看完」再写代码

Claude Code 在写代码之前,往往需要先理解一个项目的技术背景。很多时候最好的参考资料是一期 B 站或 YouTube 的技术演讲视频。/watch 之后,Claude 对这个技术的理解就建立在「实际看过」的基础上,而不是靠猜测。

场景三:快速提取视频中的代码示例

教程视频中经常会有大量代码展示。用 claude-video 处理后,Claude 收到的文字稿有时间戳,可以精准告诉用户「这段代码出现在 12:34」,并直接提取出来供用户使用。

场景四:视频内容摘要与问答

对于长视频(如 1-2 小时的学术演讲),可以直接问 Claude:「这期视频的核心论点是什么?」「有哪些关键数据?」Claude 因为已经「看过」视频,回答基于真实画面和字幕,而不是训练数据。

六、仓库结构与多平台支持

目录结构

  • skills/watch/:核心 Skill 定义文件
  • .claude-plugin/:Claude Code 插件格式
  • .codex-plugin/:Codex 插件格式
  • hooks/:钩子脚本
  • dev-sync.sh:开发同步脚本
  • CHANGELOG.md:版本变更记录
  • CLAUDE.md:Claude 项目规范

多平台兼容

项目明确支持 Claude Code、Codex、OpenClaw、Cursor 等多个主流 AI Agent 平台,跨平台兼容性做得比较完善。

七、同类项目对比

vs video-use(browser-use 团队)

video-use 的定位是「对话式视频剪辑」,把原始素材扔进文件夹,用自然语言告诉 Claude Code 想要什么,直接拿回剪辑好的 final.mp4。它的核心是剪辑,适合做视频内容的人。

claude-video 的核心是「理解和分析」,目的是让 AI 获得视频信息来做后续处理(如写教程、摘要、问答),不输出视频剪辑结果。

两者互补:video-use 负责拍,claude-video 负责看。

vs happy-claude-skills 的 video-processor

happy-claude-skills 是一个综合技能合集,其中包含 video-processor,能力与 claude-video 有重叠:视频下载、音频提取、格式转换、Whisper 转写。

区别在于:video-processor 是技能合集中的一部分,claude-video 是独立项目,专注「让 AI 看懂视频」这一件事,更轻量、更聚焦。

vs 传统视频转文字工具

传统工具(剪映、Whisper CLI 等)只做转写,输出纯文本或 SRT 字幕文件,无法让 AI 直接「拥有」视频的理解能力。claude-video 在 Whisper 转写的基础上,增加了帧提取和时间戳注入,让 Claude 获得的是有时间维度的完整视频上下文。

八、局限与注意事项

  • 依赖本地环境:需要本地安装 yt-dlp、ffmpeg 和 Whisper(ffmpeg 和 yt-dlp 自动安装,但 Whisper 模型需要额外配置)
  • 长视频成本:视频越长,帧提取越多,Whisper 转写耗时越长,发给 Claude 的上下文 token 越多,成本越高
  • 帧率选择:缩放帧率设置影响 Claude 收到的画面数量——太低可能遗漏细节,太高会增加上下文负担
  • 项目活跃度:目前 11 次 commit,项目较新,功能完善度仍有提升空间
  • 非视频剪辑工具:这个项目不生成视频,适合「看视频 + 理解」场景,不适合「剪视频」场景

九、总结

claude-video 解决了一个看似小但实际很关键的痛点:AI 看见文字、看见代码,但看不见视频。这个短板在 AI 编程助手的使用场景中尤其明显——最好的教程往往是视频,但 AI 偏偏看不了视频。

claude-video 的设计思路很务实:不重新发明轮子,用 yt-dlp 解决下载、ffmpeg 解决帧提取、Whisper 解决转写,三条成熟管线拼在一起,最后把结果交给 Claude 处理。最难得的是零配置体验,Claude Code marketplace 的自动更新机制也保证了用户总是用到最新版本。

它不追求功能的大而全,只做好一件事——「让 Claude 真正看懂视频」。在这个定位上,目前同类项目中它的体验是最顺畅的。

GitHub 地址:https://github.com/bradautomates/claude-video

相关软件

暂无评论

暂无评论...