把已经确认的内容或现有素材,制作成可继续修改、可预览、可导出的视觉、视频或音频成品。
中文 · English · 日本語 | 文档 | 贡献 | 反馈
Visual Multimedia 是一个媒体制作 Skill。它会在技术图解、代码动画、视频、音频和播客中判断合适载体,再完成对应的标题、口播、字幕、节目结构和媒体配套文字;进入制作后,它会保留唯一的活动真源,并沿真实的预览、渲染或导出链检查最终结果。独立静态卡、社交卡、纯文字卡、轮播图和独立封面已经退出;唯一窄范围静态例外,是从已有视频与事实转写派生字幕金句拼图。
真实网页案例:内容、构图与可编辑结构来自同一份活动真源,并由浏览器导出预览。
它不会替用户研究主题、筛选长材料中的分享重点或编造事实,也不会默认安装工具、购买素材、上传或发布成品。
在支持 Agent Skill 的 Agent 中加载本仓库后,直接点名 $visual-multimedia,并提供已经确认的内容或素材、受众和希望得到的结果。例如:
使用 $visual-multimedia,把这份已经确认的系统说明做成一张可编辑技术图解。
保留节点、接口和数据流关系,并导出 PNG 供文档使用。
使用 $visual-multimedia,把这段访谈和现有字幕剪成 90 秒视频。
保留受访者原声,先给我基于复核转写整理的完整中文字幕,再选择片段和安排画面。
使用 $visual-multimedia,从这段没有烧录字幕的采访中选择足以讲清主题的完整观点,再按可读字幕行制作一张紧凑连续拼图。所有行重复第一条字幕的背景帧。
使用 $visual-multimedia,把这份确认过的讲解稿做成可手动推进、也能连续导出的多场景 HTML 动画。
中文视频最终默认使用中文主字幕和英文小字幕,两层共用真实声音边界。原创视频先交付完整中文字幕内容;确认后才派生英文字幕、发音文本、声音、视觉方向和综合样片。真人原声或现成旁白则先确认经听音复核的主字幕,再按真实声音确定时间。
如果只点名 Skill 并提供内容,却没有说明要样稿还是成品,默认流程会推荐一个首选载体、完成可确认的媒体文案,然后停下来等待决定。明确要求样稿或完整制作时,流程才会继续创建网页、处理素材或导出文件。
为了减少来回确认,首次请求最好同时说明:
- 内容真源或素材在哪里,哪些事实和表达已经确认;
- 目标受众看完或听完后应理解什么;
- 想要文案、样稿还是完整成品,以及尺寸、时长或格式要求;
- 哪些图片、录音、视频、品牌资料或参考样本可以查看和使用;
- 是否允许调用外部模型、安装工具、下载素材或执行导出。
| 需求 | 主要输入 | 可观察结果 |
|---|---|---|
| 技术机制对比与系统流程图 | 已确认概念、节点关系、参考风格与静态/动态要求 | 可编辑机制图、稳定全貌动画、关键状态检查图和指定图片或视频 |
| GIF、动态图解、代码动画 | 内容关系、语义步骤与播放方式 | 可定位关键状态的网页动画,以及指定 GIF 或视频 |
| 解释型 B-roll 与视频包装 | 已确认主字幕或现成旁白、内容关系、布局比例与真实声音时间 | 自动配方选择、十类可编辑活动模板、活动时间线片段和 PNG/GIF/视频/透明输出 |
| 多场景 HTML 演示 | 完整文案、场景顺序与手动/自动/混合播放要求 | 同一网页真源中的交互演示和连续导出路径 |
| 实拍、访谈、讲课或录屏后期 | 原片、事实转写、片段范围与交付要求 | 可继续修改的时间线、字幕、混音和经过审阅的成片 |
| 视频字幕金句拼图 | 已有视频、事实转写、完整观点、对应的中英文显示行 | 一个主画面加多条满宽横图的自动高度拼图、仅限第一条字幕的背景候选、最终图片复核与准确交付报告 |
| 音频与播客 | 录音、节目结构、旁白与声音要求 | 音频时间线、混音成品和必要附属文件 |
| 参考视频复刻或对齐 | 准确参考区间、目标素材与还原层级 | 分开的精确回放或参数化重建结果,以及逐帧与人工观看证据 |
| 二次元口播角色 | 已注册角色,或确认的角色母版;生成前取得完整校准提示词;真实语音 | Agent 审查校准视频并建立版本化角色资源,再生成已复核口播轨或固定角色窗 |
| 采访原声讲解型视频 | 已选原声片段、事实转写、背景与解释文案 | 保留来源时间码的“背景—原声—解释—总结”成片与交付报告 |
| GitHub 项目介绍视频 | 已确认的仓库事实、一个核心主张,以及 UI、终端、文档或实际输出证据 | 默认采用银狼 1.25 倍速和中英文字幕的约一分钟横版视频,以及可追溯的构建、审阅与交付报告 |
| 媒体文案与口播参考库 | 已确认主张、作者声音,或明确的参考库维护请求 | 可直接制作的活动文案,或 Skill 外部的可定位参考库 |
具体任务只加载需要的制作方法。入口、适用条件和停止位置以 SKILL.md 为准。
建立自己的二次元口播角色时,不要先随意生成一段人物动作视频。尚未生成素材时,先使用完整的 15 秒校准视频提示词;已经提供视频时,由 Agent 检查固定机位、人物漂移、口型覆盖、闭嘴待机、字幕和水印,并负责后续抽帧、视觉标注、机器文件与验证。用户不需要逐帧排列素材、编辑 JSON 或运行内部命令。当前完整帧方案适合动作克制、普通话口型大体同步的角色;明显人物动作与高精度口型需要在制作前选择其它音频驱动或分层、骨骼方案。
技术机制对比:每栏用微型流程图解释工作方式,并落到产品无关的共享能力。 |
稳定全貌动态图:结构从第一帧保持不变,路径同色光点按语义事件依次移动;目录内同时提供可编辑网页和移动端 MP4。 |
- 先确认内容,再选择载体。 内容真源决定主张和边界,视觉与声音只负责降低理解成本、建立节奏和增强体验。
- 先写媒体文案,再做画面和声音。 带语音视频先确认完整主语言字幕;翻译、发音文本、声音、视觉方向和样片都从这份确认内容派生。
- 在最早未确认的层面做样稿。 文案、风格、构图、动效和声音样稿各自只验证一个层面;B-roll 只有在能增加证据、场景、动作、情绪、结果或剪切连贯性时才采用,不按句子机械切换。
- 每类成品只保留一个活动制作入口。 网页视觉以网页包为真源,视频和音频以各自时间线为真源,混合项目不在后期工具中重画网页负责的内容。
- 只使用已经授权的视觉素材。 没有被用户提供或明确允许查看的图片、视频帧和品牌资料不会被枚举、预览、采用或拿来决定风格。
- 正式交付必须经过真实消费者。 源文件能打开、脚本返回成功或 schema 通过都不等于成品可用;最终文件还要由真实浏览器、播放器、编辑器或导出链读取和检查。
Skill 先确定活动真源,再检查当前机器真正可用的能力。执行方一旦写入交付合同,运行失败不会触发静默换路。
| 执行方 | 什么时候使用 | 活动真源与交付 |
|---|---|---|
| 本地基础能力 | MediaFlow Pro 未配置、所需能力不可用,或用户明确选择本地独立制作 | editable-media v6 或 media-timeline v1 继续作为可修改真源;本地正式链可以完整生成网页、MP4、GIF、现有素材剪辑、声音和字幕 |
| MediaFlow Pro | 已配置且本轮能力检查通过时默认优先;尤其适合原生工程、桌面精调、多轨制作、版本和交接 | 导入产品无关真源;成功后 project.mfp 成为唯一活动时间线,再从同一工程导出 |
| HyperFrames | 用户明确选择把独立、无声的代码网页动画确定性渲染为视频 | 读取同一 editable-media v6 时间边界;网页包仍是真源,渲染副本只是派生输入 |
执行方只决定谁完成确定性处理和怎样交接。内容、结构、风格、制作判断和最终验收始终由 Skill 负责;MediaFlow Pro 不是必装依赖,HyperFrames 也不会因为页面使用 HTML 就被自动选中。
- 网页包: 代码生成的技术图解、图表和动画在未指定技术栈时从 DOM starter 建立;用户明确要求 React,或现有输入本身是 React 组件或工程时,从 React starter 建立。两者都生成自包含的 editable-media v6 网页包;
schemas/editable-media.v6.schema.json是唯一结构真源,本地渲染器、结构化编辑器和 HyperFrames 共用window.editableMedia与window.__hf.duration/seek(seconds)。 - 画布外编辑器: DOM 网页包可以按语义分组改字、切换经本机验证的字体与字重、调色、调整样式,也能直接点击画布文字修改;修改可刷新保留、下载、放大预览、恢复初始值并导出当前画布。Windows 用户运行
_start_editable_preview.bat即可在动态本地端口打开当前项目。 - 素材与交付合同: 图片、视频、音频和生成素材先进入带文件哈希、来源、权利、原片与代理关系的素材账本,再由网页、视频时间线或音频项目显式采用。
media-timelinev1 定义可移植时间线,media-deliveryv3 把提供方、真源文件、回执和 SHA-256 绑定到最终输出;导出文件不会成为第二个编辑入口。 - 跨轮状态:
media-project-state.json只记录制作阶段、成果哈希、确认、决定和下一步,不充当编辑器工程。项目进入 MediaFlow Pro 后,素材、时间线、项目修订和操作历史只保存在project.mfp,制作状态只索引相关合同与成果。
- 独立静态卡、社交卡、纯文字卡、轮播图或独立封面;从已有视频派生的字幕金句拼图除外;
- 通读课程、书籍或长材料后判断什么值得分享;
- 主动研究主题、补充事实、撰写长文或 Newsletter;
- 只交付能够脱离媒体独立成立的短帖或 Thread;
- 规划现场拍摄、器材、人员和拍摄日程;
- 创建或编辑 PPTX、Keynote 等幻灯片文件;
- 账号运营、排期、上传、发送或发布。
这些任务可以由其它能力先产出内容真源或完成后续发布,再把已经确认的材料交给本 Skill 制作媒体。
| 路径 | 职责 |
|---|---|
| SKILL.md | Skill 的适用边界、默认流程、任务路由和交付标准 |
| references | 按具体媒体任务加载的制作方法 |
| assets | 网页 starter、真实合同案例、制作配方和可复用资源 |
| schemas | 媒体项目、素材、审阅、角色和网页包的结构合同 |
| scripts | 导入、校验、规划、渲染、审阅与交付工具 |
| agents/ | 可选的 Agent 宿主适配元数据 |
| .project-steward/project.json | 本仓库采用的项目治理基线与版本 |
archive/ 只保存已退出路线和迁移证据,不是正常任务入口。活动流程不得从归档中恢复旧协议或旧 helper。
仓库级检查按实际改动分为三档;不带参数时等同于 --fast:
node scripts/check-skill.mjs --fast
node scripts/check-skill.mjs --browser
node scripts/check-skill.mjs --full--fast 检查 Skill、README、许可证、schema、资源索引、真实案例静态合同与脚本语法;--browser 在此基础上验证 Playwright 网页包、确定性时间、十类解释型 B-roll、文字动效、本地网页视频和产品功能宣传片链路;--full 再验证 GitHub 项目介绍的非 GUI 与网页证据、双语字幕、MediaFlow Pro 构建、审阅交付,以及导演自动选模板、真实时间投影、可移植时间线、提供方路由、五种 B-roll 导出和其它 Node、Python 生产消费回归。Python 不在系统命令路径中时,可以通过 VISUAL_MULTIMEDIA_PYTHON 指向实际解释器。
涉及 editable-media、网页 starter、素材表示、确定性时间边界或 MediaFlow Pro 公开消费合同的改动,需要同时沿生产者、同步边界、MediaFlow Pro 消费者和最终可见结果完成迁移。准确的联动范围与验证命令见 AGENTS.md;公开编辑器能力的实际入口见 references/structured-media-editor-cli.md。
本仓库的项目事实以活动源码、配置、schema、资源和测试为准。Project Steward 配置只记录采用的治理基线,不复制业务合同。
本仓库的原创源码、Skill、脚本、Schema、模板与文档采用 Mozilla Public License 2.0。个人头像、角色、品牌资料,以及项目拥有或在项目内生成的图片、音频、视频、渲染结果和预览媒体不随 MPL-2.0 授权,并依照 ASSET-LICENSE 保留全部权利。第三方内容继续遵守各自的许可证与声明。
编辑器可消费资源通过根目录 media-resource-catalog.json 发布。它只收录许可证、来源、内容哈希和采用方式已经闭合的资源;运行 node scripts/build-editor-resource-catalog.mjs 可确定性重建随附 LUT 与目录,随后用 node scripts/media-resource-library.mjs validate-catalog --catalog media-resource-catalog.json 校验。
- React 参考生产器的直接依赖、精确版本与许可证记录在 React starter third-party notices,同一声明会进入其封闭构建输出。该生产器不包含 Remotion 源码、Composition、Renderer 或其它 Remotion 运行组件。
- 视频字幕金句拼图改编所依据的 MIT 项目、修改范围与完整许可见 第三方声明。
准确的路径范围、排除项和第三方覆盖关系以 LICENSING.md 为唯一说明。
本仓库直接改编并随 Skill 分发的第三方资源如下。这里只列实际进入成品链或活动资源的内容;只学习通用方法并完全独立实现、没有复制来源 IP、示例、资源或代码的研究材料,不会被写成项目依赖。
- Vincentwei1021/video-shotcraft:
assets/shot-recipe-library/recipes/中 104 张镜头卡与 161 个风格变体的语义资料由原仓库改写而来,采用 Apache-2.0,Copyright 2026 Wei Yihao。本仓库没有复制上游 Remotion TSX、产品截图、音频、动态预览 MP4 或 Gallery 实现;准确范围、修改说明与完整许可证见 shot recipe notices。 - chengyi-ai/native-subtitle-quote-image:采用其精确取帧和主画面加横条拼接思路,改造成默认无烧录字幕、绑定事实转写、完整信息单元、统一字号与按文字实际高度紧凑拼接的生产链;采用 MIT,Copyright 2026 程意,完整条款见 第三方声明。
sakura-animate-text:assets/text-motion-library/text-motion-runtime.js的文字动效家族基于该项目确定性重写,采用 MIT License,Copyright 2026 Sakura;没有复制上游 WAAPI 播放循环、随机延迟、CDN 加载器、框架适配、示例文案、字体或站点视觉。完整声明见 text motion notices。- Xiaolai(小赖字体):
assets/web-card-cases/handdrawn-system-collaboration-flow/assets/fonts/Xiaolai-Regular.ttf用于真实手绘中文案例,采用 SIL Open Font License 1.1;完整许可证随字体保存在案例目录。 - Lucide:同一手绘案例在
index.html中内嵌 Lucide Static 1.28.0 的线性图标路径;Lucide 自有图标采用 ISC,Server、Monitor、Database 等 Feather 派生图标同时保留 Cole Bemis 的 MIT 条款。准确范围与完整许可证见 case notices。


