开放建造日志 · 求指点
我们用 Codex + Claude Code 搭了一条 AI 短片生产线 —— 卡了快 20 天没出片
这是求指点,不是教程。真实项目、真实卡点、真实数据,全部公开。 如果你真懂图生视频的真实感、或 AI agent 的长链条工作流,欢迎来拍我们肩膀。
20 天,卡在同一个地方。这次踩坑的是我们自己。
我们在做什么
想用 AI 把一条仿真实拍短片生产线做到尽量自动化。第一部片子是个伪纪录片:《凌晨 2:17,店里多了一个不存在的员工》—— 用监控、手机偷拍、聊天记录,讲一个小店老板发现自家账号里有个虚构 AI 员工「小夏」在深夜替他回差评、重剪短视频、把账号救活。 原创虚拟角色,不用真人脸、不换脸。规格:110–130 秒、9:16、16 个 5–9 秒镜头,每 8–12 秒一次反转,前 3 秒必须让人停住。
我们的框架(这部分其实做得不差)
整条线是 Codex + Claude Code 协作搭的,分阶段:
脚本 → 分镜+生成提示词 → 角色定妆 → 图生视频(16镜头) → 声音 → 剪辑 → 平台测试
- Kling —— 角色一致性、中文口型、多镜头
- Runway Gen-4 —— 真实感动作、手机/监控质感
- HyperFrames / Remotion —— 字幕、UI 证据、合成
- 自研 Python —— 资产验收、readiness 门禁、外部模型评审环
我们甚至给它定了硬验收线(防止自己骗自己):一套 pipeline:gate,只有 render_allowed=true 才准渲染;
一份发给 Grok/Gemini/Claude 的统一评审量表(首3秒留存、事件驱动、真实感…),overall < 7.6 不准进平台测试;
还卡了「技术合格 ≠ 内容合格」。这套流程纪律,老实说比大部分玩 AI 视频的人都狠。
然后我们卡住了 —— 两个层面
画面过不了「真实感」这关
我们要的是便利店监控 / 手机偷拍那种粗糙真实感——冷白灯、压缩噪点、竖拍抖动。但图生视频出来的东西,要么太「AI 炫技 / 广告棚」,要么角色脸不稳。photoreal 真实感一直过不了我们自己定的 believability ≥ 7.5;角色跨镜头总漂。
AI agent 陷入「过度工程化空转」
因为门禁卡在「素材没到位」,协作的 AI 每天能做的就只剩只读巡检 + 写反思:watchlist → delta → streak → trend → scaffold → sync 六步,循环记账。于是它不停造工具——landing 巡检、跨天 trend、path regression verifier、各种 readiness 复核脚本。每一步看起来都合理,合起来就是原地踏步。
一个数字说明一切
我们这条还没产出 1 条成片的视频线,tools/ 目录里已经躺了 437 个 Python 脚本。agent 太擅长「把流程搭得更严密」了,严密到忘了最初的目标是出片。
想请高手指点的几个问题
- 图生视频的「监控 / 偷拍真实感」到底怎么稳定做出来?是 prompt、选错了模型,还是得后期加噪点 / 降质 / 抖动?
- 跨 16 个镜头的角色一致性,2026 年现在最靠谱的做法是什么?Kling 的角色参考够吗,还是得训 LoRA / 用别的方案?
- 最想听的:你们用 Codex / Claude Code / Cursor 做长链条任务时,怎么防止它陷入「只造流程不产出」?
我们已经试过什么(不是伸手党)
- 堆 negative prompt(cartoon / sci-fi / beauty filter / distorted face…)压「AI 味」
- 搭外部模型评审环、定量表、卡硬门槛
- 拆成「先定妆图 → 再图生视频 → 每镜头只一个动作」降复杂度
- 给 agent 加了一堆 fail-close 门禁 —— 结果反而喂出了「空转造工具」这个新问题
联系 / 围观
完整前期包、分镜提示词、评审量表、那 437 个脚本的目录结构,我们都可以开放给认真想交流的人。 这是「AI 工具避坑实验室」的真实一期——这次踩坑的是我们自己。
开放建造日志 · 原样发布 · 我们脱困后会更新这一页。