Niwo Render Everything:把任意内容变成短视频的 Agent Skill

· TopDigg · AI视频 / Agent Skill / 内容创作 / Niwo / 短视频工具

Niwo Render Everything:把任意内容变成短视频的 Agent Skill

重新定义内容创作的工作流


一、项目概述

在内容创作领域,有一个长期痛点:好内容死在"做视频"这一步——写完一篇深度分析、处理完一张信息图、聊完一个值得展开的话题,却因为不会剪辑、懒得动手,让这些素材永远躺在聊天框里。

Niwo Render Everything 试图解决这个问题。它是一个 Agent Skill(智能体插件),能把 PDF、论文、网页链接、Word 文档、聊天记录——任何你能丢进 ChatGPT、Claude、Cursor 这类 AI Agent 的内容——自动整理成一个「素材包」,你再上传到 Niwo 视频工作台 渲染成片。

它不生成视频本身,但它把制作视频最繁琐的部分——写文案、找素材、裁镜头、打包交付——全部自动化了。

核心工作流

输入内容(PDF/链接/聊天)
        ↓
Agent 自动完成:
  - 读取并理解材料
  - 与用户确认成片形态、时长、受众
  - 撰写口播文案(含钩子标题)
  - 下载真实图片和 B-roll 视频
  - 用 ffmpeg 裁好每个镜头
  - 打包成 zip
        ↓
用户下载 zip → 上传到 Niwo 视频工作台
        ↓
在 Niwo 选择:成片形态(竖屏/横屏/信息版)
配音音色、背景音乐、智能音效、IP 形象
        ↓
渲染输出成片

成片形态

目前 Niwo 支持三种成片形态:

  • 竖屏信息版:9:16 画布,中间嵌 16:9 画面,顶部有大标题——信息量最足,适合抖音、视频号、小红书
  • 竖屏视频:9:16 满屏,适合纯视频内容
  • 横屏视频:16:9 满屏,适合 B 站、YouTube 和电脑端

当前版本:v1.0.0(2026-09-04 首次发布带版本号)
许可证:MIT
维护者:AudareLesdent


二、项目背景与定位

2.1 解决了什么问题

传统的短视频制作有几个门槛:

  • 文案要自己写:把一个复杂话题浓缩成 60-90 秒的口播文案,本身就是一项专业技能
  • 素材要自己找:配图、B-roll 视频,需要在多个平台间搜索、下载、筛选
  • 镜头要自己裁:一段 30 秒的视频素材,实际可能只需要其中的 5-8 秒
  • 剪辑要学软件:Premiere、Final Cut、剪映——每一样都有学习成本

niwo-render-everything 的思路是:把前三个步骤全部交给 Agent,用户只需要做最后一步——在 Niwo 工作台点一下渲染。

2.2 这不是"AI 视频生成"

需要特别澄清的是:niwo-render-everything 不生成视频画面。它做的是:

  • 根据你给的内容,生成一段口播文案(逐字朗读的正文)
  • 从网上下载真实图片和 B-roll 视频作为素材
  • 用 ffmpeg 把视频裁成符合文案的短镜头
  • 打包成符合 Niwo 规范的 .zip 素材包

最终的成片画面,来源于真实素材(你找的图片和视频),而不是 AI 生成的画面。这在当前 AI 视频生成质量参差不齐的阶段,反而是一个优势——真实素材的可控性远高于 AI 生成。

2.3 内测阶段

项目目前处于内测阶段,需要加入用户领航团才能拿到内测账号和试用积分:

  • 赠送试用积分,可直接用于视频渲染
  • 解锁邀请码分发和返利权限
  • 抢先体验最新成片形态与渲染模型

加入方式:niwo.studio/contact


三、技术架构

3.1 Agent Skill 架构

niwo-render-everything 是一个 Agent Skill——它不是一个独立的应用程序,而是一个可以安装到各种 AI Agent 中的插件。

支持的 Agent 环境

产品 推荐程度 实测状态
ChatGPT 工作模式 首选 已实测,可用
Codex(OpenAI) 推荐 已实测,可用
WorkBuddy 推荐 未实测
豆包工作模式 可用 未实测
Cursor 可用 未实测
Claude Code 可用 未实测
普通聊天 / 手机助手 不适合

为什么普通聊天不行:这个 Skill 需要三项能力——下载文件到本地、执行 shell 命令(ffmpeg)、打包 zip。普通聊天对话框通常只能给链接,不能真正下载文件,缺任何一项都跑不完。

3.2 素材包结构

Agent 完成任务后,交付一个 .zip 文件,解压后结构如下:

content.json      # 文案、标题、资料来源、多音字注音
manifest.json     # 每个素材的画面说明、标签、来源、选段时间
images/
  01-xxx.jpg      # 真实网络图片
  02-xxx.png
videos/
  01-xxx.mp4      # ffmpeg 裁好的短镜头
  02-xxx.mp4

content.json(内容协议)是整个素材包的核心,字段非常明确:

{
  "schema_version": 1,
  "title": "DeepSeek API 涨价",
  "script": "把定稿的口播文案放这里,一整段,不换行",
  "hook_headline": {
    "lines": ["DeepSeek砸1.4亿", "一锁就是[[36个月]]"]
  },
  "sources": ["DeepSeek 官方公告", "新浪财经"],
  "pronunciations": {
    "调用量": "diao4 - -"
  },
  "notes": "可选,留给用户的说明"
}

关键约束content.json 不接受任何未列出的字段。渲染参数(成片形态、音色、语速、BGM 等)由用户在 Niwo 工作台上选择,不能写进 content.json,否则直接校验失败。这体现了 Niwo 的一个重要设计原则:内容归 Agent,渲染归用户

3.3 工作流程详解

niwo-render-everything 的完整工作流分为六个步骤:

第零步:开工前检查

  • 运行 scripts/skill_update.py 检查是否为最新版
  • Skill 一直在更新,旧版产出的包可能被 Niwo 拒收
  • 检查结果按退出码处理:0=已是最新,3=离线当最新继续,10=有新版问用户,20=必须更新

第一步:确认成片参数(一次性问完)

  • 文案还没定稿时,Agent 会一轮问完五个维度

    1. 成片形态(竖屏信息版 / 竖屏视频 / 横屏视频)
    2. 目标时长(30秒 / 60秒 / 90秒)
    3. 目标受众(泛科技商业用户 / AI 开发者 / 普通用户)
    4. 风格口吻(强钩子锐评 / 客观财经分析 / 实用解读)
    5. 必讲信息点(多选)
  • 文案已定稿时,这一轮只问成片形态

  • 五题必须同一轮问完,不许跨轮追问,也不许合并选项

第二步:撰写口播文案

  • 按用户确认的时长、受众、风格撰写文案草稿
  • 竖屏信息版还要写钩子标题(hook_headline)——开场几秒里字最大的一行,从文案里提炼
  • 用户明确说「就这版」之后才算定稿

第三步:收集素材

  • B-roll 视频:从网络、公开素材网站搜索并下载真实视频
  • 图片素材:通过 Bing、百度等图片搜索引擎,找与文案内容直接相关的真实图片
  • 明确不要:原创 Motion 动效、概念动画、抽帧图、占位图
  • 一分钟到一分半的片子,通常 20-30 张图 + 8-10 段视频就够

第四步:裁切视频镜头

  • 每个镜头只用几秒,要用 ffmpeg 裁好
  • 推荐直接交裁完的短片段(8-12 秒),不要丢一段几十秒的原片
  • 裁之前用 ffprobe 确认时长,避免落在黑屏、片头台标或转场糊帧上

第五步:写 manifest.json

  • references/manifest-schema.md 的规范写
  • summary 描述画面里看得见的东西,不是含义
  • tags 2-5 个中文短标签

第六步:自校验并打包

  • 运行 scripts/validate_bundle.py 自校验
  • 检查字段合法性、manifest 与实际文件的对应关系、视频选段是否落在真实时长内
  • 校验通过后打包 zip 交付

四、content.json 协议详解

4.1 核心字段

content.json 是 Niwo 渲染体系的内容输入协议,字段含义:

字段 必填 说明
schema_version 必填 固定为 1
title 必填 片子标题,中文,上限 120 字
script 必填 定稿口播正文,一整段不换行,上限 6000 字
hook_headline 条件必填 竖屏信息版必须写,另两种形态不能
pronunciations 可选 多音字注音,避免配音读错
sources 默认写 文案引用过的公开资料名称,写进 content.json 但显示由用户在 Niwo 控制
notes 可选 留给用户的补充说明

4.2 hook_headline 的特殊规则

钩子标题(hook_headline)是竖屏信息版顶部的大标题带,从口播文案里提炼,写进 content.json。它有严格的写法规范:

  • 行数:1-3 行,推荐 2 行(第一行铺垫,第二行给结果或冲突)
  • 每行宽度:不超过 12 个中文字(英文数字按半个字算),超过 14 字校验失败
  • 高亮:至少有一处 [[ ]] 标记高亮关键词
  • 不进配音、不进字幕:只出现在视觉包装层面

示例:

"hook_headline": {
  "lines": ["DeepSeek砸1.4亿", "一锁就是[[36个月]]"]
}

为什么这个字段有条件约束

  • 竖屏信息版没有这个字段 → 顶部标题带空着,开场几秒是空白
  • 竖屏/横屏视频写了这个字段 → 字段无效,Niwo 还会把渲染界面的形态初值错误地设成竖屏信息版

4.3 内容与渲染的分离原则

这是 niwo-render-everything 最重要的设计哲学:内容归 Agent,渲染归用户

Agent 负责的内容:titlescripthook_headlinesourcespronunciationsnotes

用户在 Niwo 上控制的渲染参数:不在 content.json 里,包括:

  • 成片形态(竖屏信息版 / 竖屏 / 横屏)
  • 音色、语速
  • 字幕开关
  • IP 形象
  • 背景音乐
  • 渲染模型
  • 明暗基调(theme)

这种分离确保了:Agent 产出的素材包在不同渲染参数下都能用,用户可以在 Niwo 上反复尝试不同的成片风格,而不需要重新让 Agent 做一遍素材包。


五、安装与使用教程

5.1 环境要求

这个 Skill 需要 Agent 具备三项能力,缺任何一项都跑不完:

  1. 能联网下载文件到本地:不是只给链接,要能真正下载图片和视频
  2. 能执行 shell 命令:环境里有 ffmpegffprobe
  3. 能打包 zip 并交付

安装 ffmpeg

# macOS
brew install ffmpeg

# Linux (Ubuntu/Debian)
sudo apt install ffmpeg

# Windows: 用 winget / choco / 或下载静态二进制
winget install ffmpeg

5.2 安装 Skill

方式一:通过 Agent 安装(推荐)

打开 ChatGPT 工作模式、Codex 或其他支持的 Agent,把这句话发过去:

帮我安装这个 Skill:https://github.com/MontageAI/niwo-render-everything

Agent 会自己把插件装上。装完再把内容丢给它,让它做短视频。

⚠️ 必须在工作模式里发,不要在普通对话里发。ChatGPT 如果已经在普通聊天里聊过,点那条消息下面的 打开新分支分支到工作模式

方式二:命令行安装

# 全局安装(所有项目都能用)
npx skills add MontageAI/niwo-render-everything -g

# 只装到指定产品
npx skills add MontageAI/niwo-render-everything -g -a codex -a cursor

# 国内如果超时,先开代理再执行

手动更新

npx skills update niwo-render-everything -y

5.3 实际使用示例

安装完成后,直接跟 Agent 说:

帮我把这篇论文做成 90 秒科普短视频
把这个新闻链接做成一条竖屏
帮我把 DeepSeek 涨价这件事做成一条一分钟的竖屏短视频

Agent 会:

  1. 先读你给的材料(PDF/链接/聊天记录)
  2. 问你成片形态、目标时长、受众、风格、必讲信息点
  3. 你回答后,给出一版文案草稿(含竖屏信息版的钩子标题)
  4. 你确认「就这版」后,Agent 开始下载图片和 B-roll 视频
  5. 用 ffmpeg 裁好每个镜头
  6. 生成 content.jsonmanifest.json,打包成 zip
  7. 交给你 zip 文件

5.4 上传到 Niwo 渲染成片

zip 不是成片,是 Niwo 渲染管线的输入。拿到 zip 后:

  1. 下载到本地
  2. 打开 Niwo 视频工作台
  3. 上传 zip
  4. 走三步:选素材 → 确认内容 → 渲染配置
  5. 在渲染配置页选成片形态(竖屏信息版/竖屏/横屏)、配音音色、BGM、智能音效、明暗基调
  6. 点「开始渲染」

还没有 Niwo 账号? 先去 niwo.studio/contact 加入用户领航团,领内测邀请码和试用积分。


六、设计哲学

6.1 内容与渲染的分离

这是 niwo-render-everything 最核心的设计哲学:Agent 负责内容,用户负责渲染

传统的 AI 视频工具倾向于把"生成视频"做成一个黑箱——你给一个 prompt,出来一个视频,改不了。niwo-render-everything 选择了一条不同的路:

  • Agent 只负责内容层:文案写什么、素材用什么画面、视频裁哪几秒
  • 用户在 Niwo 工作台上控制渲染层:用什么音色、什么背景音乐、什么成片形态、要不要 IP 形象

这种分离带来了一个重要优势:同一个素材包,可以渲染出多种成片。用户可以在 Niwo 上反复尝试不同的音色、BGM 和成片形态,而不需要重新走一遍 Agent 的素材制作流程。

6.2 协议即边界

content.json 的协议设计非常清晰:不接受任何未列出的字段。这是一个强有力的约束——它用技术手段确保了"内容"和"渲染"不会互相渗透。

渲染参数(音色、语速、BGM、成片形态)不在 content.json 里,不是因为"忘了写",而是因为故意不写。这种约束在系统设计层面避免了常见的"配置膨胀"问题——当一个配置文件开始容纳越来越多不属于它的东西时,系统就会变得难以理解、难以维护。

6.3 Agent 作为"素材工人"

niwo-render-everything 对 Agent 的定位很务实:不是让 Agent 做视频,而是让 Agent 做视频制作中最繁琐的部分

写文案、找素材、裁镜头——这三件事技术含量不高,但极其耗时。Agent 擅长做这类"脏活累活",而且不会疲倦、不会烦躁、不会敷衍。把这些步骤自动化之后,人类创作者可以把精力集中在真正需要判断力的事情上:这个话题值不值得做、这个角度对不对、这条片子想表达什么

6.4 版本管理与协议演进

Skill 有完善的版本管理机制:

  • 每次开工前检查版本,有新版会提示更新要点
  • 协议字段通过 schema_version: 1 版本化
  • 更新遵循明确的兼容性规则:本地版本低于最低兼容版本时强制更新,否则用户可选更新

这种严谨的版本管理,在 AI 工具快速迭代的背景下尤为重要——当 Skill 的协议每年可能更新多次时,没有版本管理的"一次性脚本"很容易变成"定时炸弹"。


七、核心观点总结

观点一:AI 创作工具的价值在于自动化"繁琐步骤",而非替代"创作判断"

niwo-render-everything 没有试图让 AI 判断"这个话题值不值得做"或"这个视频想表达什么"。它做的是把文案撰写、素材搜索、镜头裁切这些繁琐但不需要创意判断的步骤自动化。这是一种务实的 AI 工具定位:替代操作,辅助决策

观点二:内容与渲染的分离是高质量输出的关键

把内容层(Agent 负责)和渲染层(用户控制)分开,让同一个素材包可以渲染出多种成片。这种设计尊重了一个基本事实:好的视频内容需要多次尝试不同的渲染风格才能找到最优解。如果每次改音色、改 BGM 都要重新走一遍素材制作流程,创作者就会倾向于"将就",而不是反复打磨。

观点三:Agent Skill 是 AI 原生应用的分发形态

niwo-render-everything 选择做成 Agent Skill 而不是独立 App,是有深刻逻辑的:

  • 它的用户是已经在用 ChatGPT/Claude/Cursor 的人,不需要再下载一个 App
  • 它的工作流是对话驱动的,天然适合 Agent 环境
  • 它的价值在于与 Agent 的深度集成——Agent 能读取文件、联网搜索、执行命令、打包交付,这些是独立 App 做不到的

观点四:真实素材优于 AI 生成素材

在 AI 视频生成质量参差不齐的阶段,niwo-render-everything 选择使用真实图片和 B-roll 视频作为画面来源。这是一个务实的设计决策:

  • 真实素材的可控性远高于 AI 生成
  • 不需要担心 AI 生成画面的版权问题
  • 在新闻、财经、教育等需要准确性的领域,真实画面更有说服力

观点五:协议设计即产品哲学

content.json 的协议设计——只接受规定字段、不接受渲染参数、字段含义有严格边界——本身就是一种产品哲学的体现:清晰的分层设计比灵活的大一统更可持续。当一个系统的每一层都有明确的职责边界和入口协议,它就更容易扩展而不崩溃。


八、适用场景与局限

8.1 适合的场景

1. 知识类短视频

  • 把论文、报告、行业分析转成科普视频
  • 把长文章浓缩成 60-90 秒的精华版
  • 适合:知识博主、研究者、内容创作者

2. 新闻解读视频

  • 把一个新闻事件做成竖屏解读视频
  • 真实素材 + 深度文案,比 AI 生成的画面更有说服力
  • 适合:财经博主、科技媒体

3. 产品/公司介绍视频

  • 把招股书、公司公告转成投资者解读视频
  • 适合:金融分析师、投资人

8.2 不适合的场景

1. 需要 AI 生成画面的场景

  • niwo-render-everything 不生成画面,只用真实素材
  • 如果你需要 AI 生成的动画、概念图,这个工具不适合

2. 需要复杂剪辑的场景

  • 目前只支持单线性的口播 + 素材拼接
  • 不支持多机位、复杂转场、特效包装

3. 还没有内测账号

  • 目前在内测阶段,没有账号无法使用
  • 需要先加入用户领航团

九、总结

niwo-render-everything 是一个非常务实的 AI 视频创作工具。它没有试图用 AI 生成视频(那是另一个更难的问题),而是把视频制作中最耗时但技术含量最低的步骤自动化了——文案撰写、素材搜索、镜头裁切。

它的设计哲学很清晰:内容归 Agent,渲染归用户。Agent 负责把任意内容整理成符合规范的素材包,用户在 Niwo 工作台上自由选择成片形态、配音、BGM 等渲染参数。同一个素材包可以反复渲染,尝试不同的风格,直到找到满意的结果。

这种"先内容后渲染"的分离设计,不仅让创作流程更高效,也让最终的成片质量更有保障——因为它把"判断内容"和"选择风格"这两个本质上不同的问题解耦开了。

如果你是一个知识创作者、研究者或内容从业者,有大量"值得做成视频"的内容躺在文档和聊天记录里,niwo-render-everything 值得一试。它目前还在内测阶段,但已经提供了足够完整的创作体验。


参考信息

相关阅读

  • MCP(Model Context Protocol)协议规范
  • Agent Skill 开发指南
  • ffmpeg 视频处理基础
  • 短视频内容创作方法论

Frequently Asked Questions

Who is behind TopDigg?

TopDigg is created by Eric, a researcher focused on AI trends and SEO/GEO strategies.

How often is content updated?

Blog posts are published regularly. AI Daily is updated daily with the latest AI news.

Can I republish or share content from TopDigg?

Please contact us for content licensing and collaboration inquiries.

About the Author

ERIC

AI Technology Expert, focusing on research and application of artificial intelligence and automation tools

Contact & Platforms

WeChat:360369487
Crypto Intelligence TG Group:https://t.me/btcgogopen ↗
YouTube Channel:@0XBitFinance ↗
Personal Tech Blog:topdigg.com ↗

Related Posts