# animated-voiceover 开源：一人干翻动画工作室

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-08-01 00:01
- AIHOT 分数：75
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms96t19506karo9k3wjqx5vb
- 原文链接：https://x.com/AYi_AInotes/status/2083221612778668388

## 精选理由

这个 Skill 把专业动画导演的制片流程封装成了 Agent 可执行的管道，首段锚定人声、风格图贯穿全片，工程化地解决了角色崩和声音飘的问题，个人创作者 40 块钱就能产出 2 分钟电影感科普视频，值得马上动手试。

## AI 摘要

前字节产品经理 @s1dashu 开源 animated-voiceover，一套喂给 Codex/Claude Code 的完整动画科普视频制片流程，MIT 协议，可实现 90% 自动化。

## 正文

这个Skill真的让我看到了一个人干翻一个动画工作室的可能性，我用它做了个DeepSeek V4-Flash的视频，

一个人，一条指令，40块钱，2分钟电影感动画科普视频。

不是那种一眼AI的垃圾。是角色不崩、声音一致、镜头有语言、旁白有节奏的正经片子。

这东西叫animated-voiceover，刚开源，MIT协议。作者是前字节产品经理@s1dashu，他自己已经用这套东西在小红书起号了。

它不是软件，不是App，是一套喂给Codex/Claude Code的完整制片流程。你就跟它说一句："用animated-voiceover做一条两分钟关于确认偏误的动画科普"，剩下的Agent按流程给你跑：

先研究，写完整旁白，
锁视觉风格参考图，锁角色参考图。
每15秒拆成5个镜头，每个镜头写清主体、变化、镜头运动。

先生成第1段，把人声提出来，48kHz立体声WAV锁死。

后面所有片段全部挂这同一个人声参考--声音飘的问题，工程化解决了。

逐段QC，旁白完整性、角色一致性、构图、运动，不合格重来。
最后拼成片，做封面。

最狠的是它解决问题的方式，全是工程思维，不是玄学。

AI视频最大的痛点是什么？声音每段都不一样，角色脸走着走着就变了，镜头之间没有逻辑。

他怎么干的？先做第一段，把人声锚定，后面全挂这个参考。

一张风格图贯穿全片，每个角色独立参考图+角色表管理。

旁白写完再切，中文卡到每15秒60个字，多一个少一个都不行，信息密度均匀，不机械。

这不是"帮我生成个视频"，这是把一个专业动画导演脑子里的制片流程，变成了Agent可以执行的Skill。

一条2分钟的片子，LibTV跑下来大概40块钱。一个人，一个下午，从选题到成片。以前这活儿得一个团队干一周。

作者反复强调一句话：90%自动化，但那10%人的判断决定上限。你定选题、定风格、卡审批，剩下重复的、容易出错的、熬人的，全交给Agent。

这才是Agent Skill该有的样子，

不是跟你聊天，不是帮你写个Prompt，是把一整条专业生产管线--从研究到脚本到分镜到渲染到QC到成片--封装成一个你随时可以调用的能力。

知识博主、超级个体、想做深度内容但不会动画的人，这个东西的价值怎么强调都不过分。B站、小红书那些电影感科普号，以前得团队作战，现在一个人就能干。

GitHub搜s1dashu/animated-voiceover，SKILL.md和references目录里全是干货，旁白怎么写、分镜怎么拆、声音怎么锁、Seedance的提示词怎么用，全给你摊开了。

别再问AI能不能替代内容创作者了，会用这种工具的创作者，正在替代不会用的。

### 引用推文

> sida：最近我在用 Codex 配合 LibTV CLI 制作动画科普视频(Animated Voiceover Video),同时运营一个小红书账号。目前小红书账号正在稳步起步,数据看起来相当健康。 现在我把这个 Skill 开源出来了: https://github.com/s1dashu/animated-voiceov...
