字幕只是开始:claude-real-video的--text-anchors文字锚点,让LLM看懂屏幕上的每一行字
字幕只是开始claude-real-video的--text-anchors文字锚点让LLM看懂屏幕上的每一行字【免费下载链接】claude-real-videoLet Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames transcript, from a URL or local file. Runs locally, MIT.项目地址: https://gitcode.com/gh_mirrors/cl/claude-real-videoclaude-real-video 是一个让 LLM 真正看懂视频的开源工具它从 URL 或本地文件里提取场景关键帧 带时间戳的字幕文本全程本地运行。而它的--text-anchors文字锚点参数更进一步——在每条字幕出现的时间点强制抓取一帧画面让屏幕上逐行变化的文字、图表、文字卡片都能被模型亲眼看到而不是只听到嘴上说的那部分。为什么字幕只是开始大多数让 AI 看视频的方案本质是读转录文本。但有一类内容含义变化得比画面还快录屏教程画面静止一分钟代码却改了十行课程讲座幻灯片不动讲师讲了三个知识点文字卡片短视频黑底白字一句一句话术在切换crv 的核心逻辑是检测到场景变化才取帧。画面不动就取不到帧——于是屏幕上信息最密集的时刻反而被漏掉了。上面这张图是一个中文录屏的默认分析结果crv 只保留了 6 帧。演示中最信息量大的五条要点完整渲染的画面其实被漏掉了——这正是场景检测的盲区。--text-anchors 是如何工作的文字锚点的设计思路很直接字幕的时间戳就是文字在屏幕上换装的时刻。第 1 步找到视频自带的字幕时间戳crv 按固定顺序找字幕本地文件旁边的.srt/.vtt副字幕文件sidecar视频内嵌的字幕轨道比如 YouTube 下载下来的软字幕对应实现在_subtitle_cue_times拿到每一条字幕的起始秒数如果视频根本没有字幕就返回空列表安静跳过。第 2 步把时间戳换算成必须抓取的帧_text_anchor_frames把每条字幕的起始时间换算成帧序号并有一个保护机制每秒最多强制一帧。密集字幕卡拉OK式逐字、快速对白不会把抽取过程拖垮。这些强制帧会合进 crv 原有的同一次 ffmpeg 抽取路径里extract_frames时间顺序、去重逻辑都不受影响。换句话说场景检测照旧跑--scene、去重阈值一律不变文字锚点只是额外保底讲到哪句就保证有一帧对着那句话与--adaptive慢变化内容兼容两者可以同时开第 3 步窗口模式下依然落在正确位置如果你用--from/--to只分析视频的一部分锚点的帧序号会自动重新对齐到窗口起点。这一点有专门的回归测试守护tests/test_text_anchors.py。三步上手最快配置方法① 安装需要 ffmpegmacOS 用brew install ffmpegpip install claude-real-video[whisper]② 准备字幕本地视频放一个同名的.srt或.vtt在旁边即可例如lecture.mp4lecture.srt软字幕则内嵌在视频里。③ 运行crv https://www.youtube.com/watch?v... --text-anchors # 或本地文件 crv lecture.mp4 --text-anchors --frame-width 1600 文字本身就是信息量时记得配合--frame-width 1600——默认 640px 的帧能找到那一刻但看不清小字。分析完成后把crv-out/文件夹帧 MANIFEST.txttranscript.txt丢给 Claude / ChatGPT / Gemini 提问即可所有帧都带源视频时间戳。真实效果与诚实的边界crv 维护者跑过一套基准测试见 benchmark/benchmark.md文字类内容正是默认采样的失分点场景默认采样结论中文录屏58 秒6 帧漏掉完整要点画面文字填入固定版式去重器看不见快切文字卡片 reel3 帧漏掉约半数话术卡片--text-anchors正是为此设计的参数同时要知道它的诚实边界README 原文⚠️ 烧录在画面像素里的字幕检测不到——它是靠字幕时间戳工作的不是 OCR⚠️ 视频必须有副字幕文件或内嵌字幕轨道否则参数静默不生效✅ 不改变场景检测行为最多每秒多一帧token 开销可控相关源码与文档参数定义src/claude_real_video/cli.py核心实现锚点换算 字幕读取 抽取合并src/claude_real_video/core.py行为测试tests/test_text_anchors.py完整参数表与安装指南README.md给 Agent 的技能说明skills/claude-real-video-for-agents/SKILL.md小结想让 LLM 看懂视频光有它说了什么还不够——还得有它画出了什么。--text-anchors用字幕时间戳给帧抽取上了一道保险每一句话都有一帧对应的画面。一个开关成本极低却让录屏、讲座、文字卡这类内容的理解质量发生质变。【免费下载链接】claude-real-videoLet Claude (or any LLM) actually watch a video — scene-aware, deduplicated frames transcript, from a URL or local file. Runs locally, MIT.项目地址: https://gitcode.com/gh_mirrors/cl/claude-real-video创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考