ARTICLE DETAIL

资讯详情

深耕编程入门与网站建设的一线实战洞察。

重大升级:安装一个 Skill,让 AI 在一杯咖啡时间内自动剪出成片,并保留可编辑工程

重大升级:安装一个 Skill,让 AI 在一杯咖啡时间内自动剪出成片,并保留可编辑工程 重大升级安装一个 Skill让 AI 在一杯咖啡时间内自动剪出成片并保留可编辑工程Timeline Studio v0.9.1 正式发布。只需要安装一个 Agent Skill提供图片、视频、产品素材或者网站地址AI 就能自动完成内容分析、脚本规划、配音、字幕、镜头剪辑和视觉引导并同时交付最终视频与可继续修改的.timeline工程。GitHub 仓库https://github.com/MartinDelophy/ai-video-editorSkill 安装页https://skills.sh/MartinDelophy/ai-video-editor一、这次为什么是一次重大升级Timeline Studio 最初是一个本地优先、直接运行在浏览器中的 AI 视频编辑器。随着功能不断完善我们逐渐发现只在编辑器里增加 AI 配音、字幕、音乐、修复和跟踪能力还不够。真正能够改变视频生产效率的是让 Agent 理解用户需求、分析素材、规划镜头、操作编辑器、检查结果并交付一个可以继续修改的工程。因此在 v0.9.1 中我们重新设计了edit-timeline-studioAgent Skill。现在用户只需要描述最终想要的视频请把这个网站制作成一条英文介绍视频。 使用自然女声专业可信但有活力16:9约 60 秒。 先体验网站的公开页面。如果关键功能需要登录 请让我在浏览器中自行登录。 画面保持稳定使用真实交互、关键帧放大、 下划线和准确框选突出重要功能。 最终输出成品视频和可继续修改的工程文件。接下来可以暂时离开去喝一杯咖啡。Agent 会自动完成第一次完整剪辑并交付project-name.mp4 project-name.timelineMP4 可以直接发布.timeline则可以重新导入 Timeline Studio 继续修改。二、安装 Skill 即可使用通过 skills.sh 安装npx skillsaddMartinDelophy/ai-video-editor\--skilledit-timeline-studio安装到 Codexgh skillinstallMartinDelophy/ai-video-editor\edit-timeline-studio\--agentcodex\--scopeuser\--pinv0.9.1安装到 Claude Codegh skillinstallMartinDelophy/ai-video-editor\edit-timeline-studio\--agentclaude-code\--scopeuser\--pinv0.9.1GitHub Copilot、Gemini CLI、Cursor 等支持 Agent Skills 的客户端也可以从同一个 GitHub 仓库发现这套 Skill。三、不是“一键套模板”而是先理解内容传统自动剪辑经常采用固定模板检测静音删除空白按固定时长切片套用统一转场生成字幕导出视频。这种方式可以处理简单素材但很难完成专业的产品宣传、教程或网站介绍。Timeline Studio 的工作流首先会识别内容类别类型需要优先保护的内容人物口播语义、表情、自然停顿和人物稳定性教程演示指令、操作与结果的对应关系访谈对话说话人身份、问答关系和真实语境Vlog/活动事件发展、自然声和镜头变化产品营销产品身份、卖点证据、品牌和行动号召叙事纪录人物、因果关系和时空连续性网站宣传页面证据、真实交互、隐私和视觉引导分类的目的不是选择一个模板而是为不同内容应用不同的保护规则。例如教程中的“讲解—点击—结果”必须被视为一个整体产品宣传不能因为 AI 生成的画面更漂亮就改变包装文字、Logo、颜色或者产品结构。四、图片和视频如何分析对于图片Agent 会检查人物、产品和主要视觉主体Logo 与品牌关键元素可读文字图像清晰度分辨率裁切空间景深和分层条件是否适合直接使用、2.5D、图生视频或图生图处理。对于视频分析会组合镜头边界代表帧OCR语音与字幕人物、产品和界面区域全局光流主体区域光流模糊、遮挡与失焦动作开始与结果出现的时间点。光流只负责分析运动不能单独证明一个区域的语义。因此系统会先判断“画面中的对象是什么”再利用光流判断“它如何移动”。这让 Agent 可以区分全局运动 → 相机移动或相机抖动 局部运动 → 人物、产品或界面内容移动 稳定区域 → 适合阅读、突出或停留 异常运动 → 模糊、遮挡或跟踪失败在进行跟踪和视觉增强之前系统会优先处理不必要的全局抖动。五、自动剪辑之前先生成决策记录Agent 不会分析完成后立即修改时间线。它会先构建一份剪辑决策记录{category:website-walkthrough-promo,goal:product-introduction,targetDurationSeconds:60,aspectRatio:16:9,narrationLanguage:en-US,voiceProfile:{genderPresentation:female,style:professional-energetic},mustKeep:[product value,real interaction,visible result],mustAvoid:[private account information,unsupported product claims,camera shake,tracking drift]}然后为素材中的重要时间范围记录保留删除缩短重排加速强调保护音频连续性保护字幕边界。每个重要决定都会保留原因和置信度。对于存在实质性歧义的问题Agent 会向用户询问对于能够直接从素材中观察到的内容则不会重复提问。六、网站宣传视频不再是截图轮播网站宣传是本次升级重点优化的场景。拿到一个网站地址后Agent 不会只截取首页。它会先构建页面和流程覆盖清单主页功能页面产品列表详情页面搜索与筛选关键操作流程登录后的产品界面外部链接具有真实外部影响的操作。如果关键页面需要登录Agent 会要求用户自行在浏览器中完成登录而不会索要密码短信验证码一次性口令CookieToken账户恢复信息。如果用户不方便登录Agent 只会基于公开页面继续制作并把无法访问的能力标记为“未验证”。在获得授权的页面范围内Agent 可以通过脚本驱动真实浏览器完成平滑滚动鼠标移动hover 状态标签切换搜索和筛选加载到结果的变化页面视频播放可逆的表单预览临时鼠标光环和焦点提示。脚本不能提交订单、发布内容、发送消息、修改账户资料或者执行其他有外部影响的操作。七、专业动效不等于“到处画矩形框”我们在早期测试中发现自动生成的网站视频很容易出现两个问题每个页面都使用矩形框画面始终在放大、缩小和移动。这种视频虽然“有动效”却不具备专业质感。在新工作流中Agent 会根据目标选择不同的视觉引导方式小而密集的界面关键帧放大精确文字和数字下划线或括线按钮、卡片和结果准确框选需要保留上下文聚光遮罩需要解释元素关系引导线视频中的移动对象光流辅助跟踪静态产品图片景深或 2.5D 分层。一个标准的解释镜头遵循建立上下文 ↓ 引导注意 ↓ 锁定目标 ↓ 静止阅读 ↓ 自然释放画面抵达目标后必须停稳让观众有足够时间阅读。我们明确拒绝无意义的持续缩放模拟手持画面微抖动弹性过冲框选漂移重复放大和缩小滚动和变焦同时发生为了展示效果而堆叠效果。八、先生成自然配音再决定画面时长不少自动视频会先固定 60 秒画面再把配音强行压缩到 60 秒。这样很容易导致语速过快停顿消失字幕闪过品牌名发音错误画面重点与配音错位。Timeline Studio 会先确认配音语言女性、男性或指定声音年龄感专业、可信、温暖、活力或沉稳等表达风格品牌名、网址、数字和专业词的读法字幕语言自然语速。配音确认后再根据每句话的实际长度和自然停顿安排画面。如果文案超过目标时长系统优先修改和压缩文案而不是粗暴加速声音。光标到达、框选锁定、下划线出现、关键帧放大和结果展示也会同步到对应的语句。九、.timelinev3一条字幕对应一个音频文件这是本次工程结构中非常重要的一项升级。过去一整段旁白可能只有一个音频文件时间线中的多个句子只是引用不同时间范围。这样虽然在界面上看起来已经分段实际修改一句配音时仍然会影响完整音频。最新的.timelinev3 会将句子级配音物理拆分caption-01 → voice-01.wav caption-02 → voice-02.wav caption-03 → voice-03.wav字幕通过audioClipId与音频片段一一对应。归档结构类似project.timeline ├── project.json ├── media/ │ ├── visuals/ │ │ ├── 001-homepage.png │ │ └── 002-product.png │ └── audio/ │ ├── voice-001.wav │ ├── voice-002.wav │ ├── voice-003.wav │ └── music.wav重新打开工程后用户可以替换其中一句配音调整一句话的开始时间修改音量和淡入淡出更新对应字幕删除其中一个句子重新生成局部声音保留其他已经确认的结果。十、播放循环问题是如何解决的在多媒体时间线中如果使用当前视频元素的currentTime作为总时间线时钟视频在片尾发生解码停顿时播放头可能一直被限制在当前片段末尾。用户看到的表现就是视频在某一个片段中不断循环。原来的关系接近Video currentTime ↓ Timeline playhead ↓ Other media现在改为Monotonic Timeline Clock ├── Video ├── Voiceover ├── Music ├── Captions └── Effects时间线成为单调递增的主时钟视频和音频只作为跟随者。核心逻辑可以概括为constwallClockTimeMath.min(timelineDuration,playbackStartTime(now-playbackStartedAt)/1000);currentTimelineTimewallClockTime;同时片段区间从闭区间判断timestarttimestartduration调整为半开区间timestarttimestartduration这样可以避免在两个相邻片段的公共边界上同时激活两段媒体。十一、本地优先与 ModelScope 双线路模型交付Timeline Studio 将多种 AI 能力放在浏览器中运行多语言 AI 配音Whisper 自动字幕Stable Audio AI 音乐人物与物体检测智能画面人像处理AI 修复高清增强人声分离数字人相关能力。模型采用按需下载和版本固定策略并通过 Hugging Face 与 ModelScope 双线路交付。对于国内网络环境Timeline Studio 优先选择 ModelScope当线路不可用时再使用对应的 Hugging Face 镜像。两家平台使用统一缓存身份ModelScope artifact │ ├── same revision ├── same checksum └── same cache identity │ Hugging Face artifact因此切换模型来源不会让浏览器重复下载同一个模型。运行流程如下用户第一次选择 AI 能力 ↓ 检查本地缓存 ↓ 检测模型线路 ↓ 下载缺失文件 ↓ 初始化浏览器推理 ↓ 后续任务直接复用这种本地优先架构带来的价值包括原始素材不需要为了基础编辑上传到后端模型下载后可以重复使用国内外网络环境可以使用不同镜像模型版本和许可证更加清晰Agent 和人工编辑共享同一个项目状态导出结果更容易复现。涉及人脸替换、数字人或其他深度合成能力时使用者必须取得相关素材的合法授权不得生成或传播违法、侵权、虚假或误导性内容也不能将生成结果冒充为真实影像。十二、命令层与浏览器层协同Timeline Studio 的 Agent 自动化分为两条路径。1. 版本化命令路径对于命令层已经支持的操作Agent 会先检查工程再构建声明式编辑计划npmrun agent -- project.inspect /absolute/path/project.timelinenpmrun agent -- project.diff /absolute/path/edit-plan.jsonnpmrun agent -- project.run /absolute/path/edit-plan.jsonnpmrun agent -- project.inspect /absolute/path/project-v2.timeline其中project.inspect读取工程摘要track.inspect检查具体轨道clip.inspect检查片段transcript.inspect检查字幕和配音关系project.diff进行不写文件的语义 dry runproject.run执行通过验证的编辑计划project.render渲染当前支持的便携工程子集。命令操作使用稳定 ID、修订号、操作 ID 和前置条件支持事务和幂等控制。2. 浏览器兼容路径对于以下能力Agent 会使用 Timeline Studio 编辑器AI 配音自动字幕复杂效果网站交互实时预览尚未进入命令注册表的编辑操作富媒体最终导出。Skill 会明确区分两条路径不会把浏览器自动化描述成完全确定性的无头执行。十三、一键成片之后如何快速修改因为最终保留了.timeline工程用户后续可以直接提出局部修改需求。例如请打开这个工程。 将第二句英文配音替换为新的文案 同时更新对应字幕。 把第三个镜头延长 1.5 秒 其余已经确认的画面、配音和音乐保持不变。 重新导出视频。也可以继续调整单个镜头镜头顺序字幕内容字幕样式某一句配音背景音乐音量淡入淡出放大位置框选范围转场视频比例不同语言版本。这让 Agent 的工作从“一次性生成”变成“持续协作”。十四、我们如何定义任务完成成功调用导出接口并不代表视频已经完成。Timeline Studio 会检查两类结果。结构正确性.timeline能否重新打开媒体文件是否完整字幕与配音是否一一对应主画面是否可见第一帧能否正常渲染轨道时间是否正确轨道显隐和锁定状态是否恢复导出视频是否包含真实音频分辨率、时长和帧数是否正确播放是否可以连续跨越全部片段边界。编辑质量是否存在画面抖动跟踪是否漂移框选是否准确产品或人物身份是否被改变配音是否自然字幕是否有足够阅读时间强调效果是否与声音同步画面是否遮挡关键内容需要阅读时画面是否停稳是否堆叠了过多效果。只有结构和质量都通过检查任务才算完成。十五、这次升级意味着什么过去AI 视频工具通常交付一个结果。现在Timeline Studio 希望交付一套可以持续工作的生产流程用户提出需求 ↓ Agent 理解素材与目标 ↓ Agent 自动完成第一次剪辑 ↓ 交付 MP4 .timeline ↓ 用户提出局部修改 ↓ Agent 调整指定片段 ↓ 重新验证并导出用户不需要学习所有剪辑工具也不需要每次从零生成。第一次任务只需要一杯咖啡的时间之后的修改则可以基于原工程快速完成。结语我们认为AI 视频编辑下一阶段的竞争点不只是生成模型能否做出漂亮画面。真正重要的是能否理解素材能否保护事实和品牌能否规划清晰的叙事能否生成自然配音能否稳定、准确地引导观众能否交付可继续编辑的工程能否在用户修改需求时只调整必要部分。Timeline Studio 想做的事情可以概括为一句话安装一个 Skill一杯咖啡的时间获得一条成品视频保留一个可编辑工程承接之后的每一次调整。GitHub 仓库https://github.com/MartinDelophy/ai-video-editor相关地址Skill 安装https://skills.sh/MartinDelophy/ai-video-editor如果这个项目对你有帮助欢迎 Star、提交 Issue或者告诉我们你最希望交给 AI 自动完成的视频制作场景。
返回列表