核心问题: 你的剪辑瓶颈是否集中在重复性的裁剪和组装,而非传统 GUI NLE 更擅长的精细视效?
RepoDaily 采用评分
RepoDaily 将该项目的采用分评为 91/100(强):分数来自文章来源、安装路径、生产风险、差异化、许可证清晰度以及 AI/Agent 适配度。
包含 4 个来源、覆盖 4 类来源;如有 RepoDaily 独有模块,会进一步提高证据分。
检测到 6 个工作流步骤、6 个下一步动作,以及 6 个命令/安装信号。
趋势热度为 +722 stars;如内容中有 release、issue 或维护信号,会提高维护可信度。
采纳风险标记为 medium,并包含 4 条安全说明与 4 条跳过条件。
3 个机会视角、4 个替代方案,以及 3 个类型化模块支撑差异化判断。
文章中包含许可证来源或许可证表述。
文章正文和元数据中检测到 7 个 AI/Agent 相关信号。
项目概览
video-use 是 Browser Use(即 browser-use 网页代理项目背后的团队)推出的对话驱动视频编辑技能。你不需要打开 DaVinci Resolve 或 Premiere,只需把编码代理指向一个装有原始素材的文件夹,输入一句话比如「把这些剪成一条发布视频」,代理会盘点素材、提出策略、等你确认,然后在素材旁边渲染出 final.mp4。项目以 Python 包形式发布,附带技能定义层(SKILL.md),Claude Code、Codex、Hermes 和 Openclaw 都可以注册并调用它。
核心设计在于 LLM 从不真正「看」视频,而是「读」视频。每个素材文件通过 ElevenLabs Scribe 转写一次,产出带词级时间戳、说话人分离和音频事件(如 (laughter)、(applause))的文本,然后打包成一个约 12 KB 的 takes_packed.md 文件。这个 markdown 成为模型的主要阅读视图,让它能够以词级精度决定剪切点。
该技能自动处理粗剪中繁琐的部分:去除口癖(umm、uh、错误开头)、修剪镜头间的空白、通过可配置的 ffmpeg 链应用一致的调色、在每个剪切点插入 30 毫秒音频淡入淡出以避免爆音、并以可自定义的样式烧录字幕。它还会生成动画叠加层——通过 HyperFrames、Remotion、Manim 或 PIL 以并行子代理方式运行——然后在呈现结果前在每个剪切边界自检渲染输出。会话记忆持久化在 project.md 中,后续会话无需重新读取全部内容即可恢复。
为什么现在变热
- 周期内获得 722 颗星,排名第 8,搭上了编码代理技能替代 GUI 应用的趋势浪潮。
- 把高摩擦的创意任务——视频剪辑——变成 prompt 即走的循环,无需时间线、预设或菜单。
- 代理运行时无关:支持 Claude Code、Codex、Hermes 和 Openclaw,覆盖面超出单一厂商。
- Browser Use Box 集成支持从 VPS 或 Telegram 机器人进行常驻编辑,扩展了项目的使用场景。
解决什么问题
- 传统 NLE 对简单的口播、教程或采访剪辑施加了过高的 UI 开销,而这些场景中 80% 的工作只是去掉口癖和空白。
- 在 GUI 工具中跨会话复现一致的剪切淡入淡出、字幕样式和调色既手动又容易出错。
- 上下文丢失:一周后回到项目通常意味着重新观看素材才能记起上次停在哪里。
- 在剪辑之外生成动画叠加通常需要单独的渲染管线和手动重新整合。
工作原理
- 克隆仓库并符号链接到代理的技能目录(例如 ~/.claude/skills/video-use)。
- 运行 uv sync 或 pip install -e . 安装 Python 依赖,然后 brew install ffmpeg 安装必需的媒体后端(yt-dlp 可选,用于下载在线素材)。
- 复制 .env.example 为 .env 并编辑 ELEVENLABS_API_KEY 行,填入你的 ElevenLabs API 密钥。
- 将提供的 setup prompt 粘贴到代理中;它会读取 install.md、配置 ffmpeg、注册技能,并提示你输入 API 密钥。
- 将代理指向装有原始素材的文件夹,输入自然语言指令,例如「把这些剪成一条发布视频」。
- 代理通过 ElevenLabs Scribe 转写每个素材,将所有镜头打包到 takes_packed.md(约 12 KB),提出剪切策略,等待确认后渲染 edit/final.mp4。
具体试用路径
- 克隆:git clone https://github.com/browser-use/video-use ~/Developer/video-use
- 链接:ln -sfn ~/Developer/video-use ~/.claude/skills/video-use(Codex 用 ~/.codex/skills/video-use)
- 安装依赖:cd ~/Developer/video-use && uv sync(替代方案:pip install -e .)
- 安装 ffmpeg:brew install ffmpeg(必需)。可选:brew install yt-dlp 用于下载在线素材。
- 配置密钥:cp .env.example .env,然后设置 ELEVENLABS_API_KEY(在 elevenlabs.io/app/settings/api-keys 获取)。
- 运行:cd /path/to/your/videos && claude,然后在会话中输入剪辑指令。
- 输出出现在 <videos_dir>/edit/final.mp4;技能目录保持干净。
集成接口
video-use 与代理运行时无关——README 明确列出 Claude Code、Codex、Hermes 和 Openclaw 为兼容运行时。它依赖 ElevenLabs Scribe 提供带说话人分离和音频事件检测的词级转写。ffmpeg 是剪切、淡入淡出和调色的必需媒体后端。动画叠加层可通过 HyperFrames、Remotion、Manim 或 PIL 生成,每个都以并行子代理方式启动。对于常驻编辑,Browser Use Box(browser-use.com/bux)封装了该技能,使其可从 VPS 运行或通过 Telegram 响应。
部署说明
要求 Python >=3.10(见 pyproject.toml)。核心运行时依赖为 requests、librosa、matplotlib、pillow 和 numpy。Manim 是 [project.optional-dependencies] 下名为 animations 的可选依赖。项目使用 setuptools 作为构建后端(requires setuptools>=61.0)。输出隔离在 <videos_dir>/edit/ 中,保持技能目录干净。会话状态持久化在项目根目录的 project.md 中。
谁适合关注
适合关注
- 你已经日常使用 Claude Code 或其他编码代理,拥有基于 Shell 的工作流。
- 你的内容以对话为主:口播、采访、教程、播客或 Vlog,主要工作是去掉口癖和空白。
- 你希望有可复现的字幕样式和调色,而不是每次会话都在 GUI NLE 里重新配置。
- 你需要跨会话回到项目,并希望代理通过 project.md 记住之前的决策。
可以先跳过
- 你需要帧级精确的视效、多轨合成或高级混音,这些是时间线 NLE 的原生强项。
- 你没有或无法获取 ElevenLabs API 密钥(Scribe 是转写后端)。
- 你在 Windows 上且没有 ffmpeg 或对 Unix 友好的技能目录结构。
- 你的素材需要超出 Remotion、Manim、PIL 或 HyperFrames 模板表达能力的重度动态图形或 3D 工作。
风险与注意事项
项目处于 v0.1.0,依赖面较窄(Python 3.10+、ffmpeg、ElevenLabs API 密钥),但依赖付费外部 API,且假设用户熟悉编码代理运行时。
- pyproject.toml 中版本为 0.1.0,标志着 1.0 前的成熟度;API 和技能格式预期可能变化。
- 每次转写都需要付费的 ElevenLabs Scribe API 密钥;成本随素材时长和会话次数增长。
- 代理运行时兼容性取决于各工具支持的技能格式;Claude Code 是主要测试目标。
- ffmpeg 必须单独安装(brew install ffmpeg),在 Python 打包之外增加了系统级前置条件。
- API 密钥存储在从 .env.example 复制的本地 .env 文件中——在推送任何 fork 之前确认 .env 已在 .gitignore 中。
- 代理按设计拥有 Shell 访问权限(uv sync、pip install、ffmpeg 调用)——在隔离的用户账户或容器中运行。
- 未文档化网络沙箱层;技能会调用 ElevenLabs 端点,并可能通过 yt-dlp 获取在线素材。
- MIT 许可证(版权所有 2026 Browser Use)允许商业使用、修改和再分发,不提供任何担保。
替代方案比较
| 方案 | 适用场景 | 代价 |
|---|---|---|
| 你想用 React 以全代码控制方式构建程序化视频和动画叠加,而非剪辑已有素材。 | 个人免费;公司超过阈值需付费许可。 | |
Manim | 你的重点是数学或教育动画渲染,而非剪辑原始素材。 | 免费,MIT 许可。 |
| 你希望将 HeyGen 的动画叠加管线集成为子代理目标。 | 查看仓库了解当前许可。 | |
Adobe Premiere Pro / DaVinci Resolve | 你需要完整的时间线 NLE,支持多轨合成、调色面板和混音。 | 商业订阅或一次性许可。 |
这个趋势说明了什么
内部播客后期制作流水线
将 video-use 接入类 CI 自动化:从对象存储拉取原始节目录音,通过 Browser Use Box 无头运行技能,并将 edit/final.mp4 带烧录字幕发布到 CDN。
录制一段 10 分钟测试节目,本地运行技能,通过 ElevenLabs Scribe 测量转写成本,确认剪辑质量达到编辑标准后再进行自动化。
多语言字幕工作流
由于 takes_packed.md 包含词级时间戳和说话人标签,你可以扩展 helpers/ 脚本来翻译片段并烧录本地化字幕轨道,而无需修改核心剪切逻辑。
Fork 仓库,在转写后添加翻译步骤,为一个样本片段渲染带翻译字幕的第二个 final.mp4。
教程和课程组装服务
对于制作口播教程的教育者,该技能的口癖移除和 30 毫秒剪切淡入淡出可处理大部分组装工作。叠加自定义 ffmpeg 链实现品牌一致的调色。
端到端处理三个已有的原始教程,对比总编辑时间与你当前 NLE 工作流,确认输出达到发布标准。
RepoDaily 判断
video-use 将编码代理技能模式应用到一个真正令人头疼的创意任务上。其设计——把视频读成约 12 KB 的 markdown 转写文本,以词级精度剪切,在边界自检——具体且边界清晰。在 v0.1.0 且依赖 ElevenLabs API 的阶段,它还不是生产级 NLE 替代品,但对于已经熟悉 Claude Code 的独立创作者和开发团队来说,它可以显著压缩对话密集型素材的粗剪时间。