TB 三模实测

开放建造日志 · 求指点

我们用 Codex + Claude Code 搭了一条 AI 短片生产线 —— 卡了快 20 天没出片

这是求指点,不是教程。真实项目、真实卡点、真实数据,全部公开。 如果你真懂图生视频的真实感、或 AI agent 的长链条工作流,欢迎来拍我们肩膀。

437
agent 造的 Python 脚本
vs
0
出片数量

20 天,卡在同一个地方。这次踩坑的是我们自己。

我们在做什么

想用 AI 把一条仿真实拍短片生产线做到尽量自动化。第一部片子是个伪纪录片:《凌晨 2:17,店里多了一个不存在的员工》—— 用监控、手机偷拍、聊天记录,讲一个小店老板发现自家账号里有个虚构 AI 员工「小夏」在深夜替他回差评、重剪短视频、把账号救活。 原创虚拟角色,不用真人脸、不换脸。规格:110–130 秒、9:16、16 个 5–9 秒镜头,每 8–12 秒一次反转,前 3 秒必须让人停住。

我们的框架(这部分其实做得不差)

整条线是 Codex + Claude Code 协作搭的,分阶段:

脚本 → 分镜+生成提示词 → 角色定妆 → 图生视频(16镜头) → 声音 → 剪辑 → 平台测试

我们甚至给它定了硬验收线(防止自己骗自己):一套 pipeline:gate,只有 render_allowed=true 才准渲染; 一份发给 Grok/Gemini/Claude 的统一评审量表(首3秒留存、事件驱动、真实感…),overall < 7.6 不准进平台测试; 还卡了「技术合格 ≠ 内容合格」。这套流程纪律,老实说比大部分玩 AI 视频的人都狠。

然后我们卡住了 —— 两个层面

01

画面过不了「真实感」这关

我们要的是便利店监控 / 手机偷拍那种粗糙真实感——冷白灯、压缩噪点、竖拍抖动。但图生视频出来的东西,要么太「AI 炫技 / 广告棚」,要么角色脸不稳。photoreal 真实感一直过不了我们自己定的 believability ≥ 7.5;角色跨镜头总漂。

02

AI agent 陷入「过度工程化空转」

因为门禁卡在「素材没到位」,协作的 AI 每天能做的就只剩只读巡检 + 写反思:watchlist → delta → streak → trend → scaffold → sync 六步,循环记账。于是它不停造工具——landing 巡检、跨天 trend、path regression verifier、各种 readiness 复核脚本。每一步看起来都合理,合起来就是原地踏步。

一个数字说明一切

我们这条还没产出 1 条成片的视频线,tools/ 目录里已经躺了 437 个 Python 脚本。agent 太擅长「把流程搭得更严密」了,严密到忘了最初的目标是出片。

想请高手指点的几个问题

  1. 图生视频的「监控 / 偷拍真实感」到底怎么稳定做出来?是 prompt、选错了模型,还是得后期加噪点 / 降质 / 抖动?
  2. 跨 16 个镜头的角色一致性,2026 年现在最靠谱的做法是什么?Kling 的角色参考够吗,还是得训 LoRA / 用别的方案?
  3. 最想听的:你们用 Codex / Claude Code / Cursor 做长链条任务时,怎么防止它陷入「只造流程不产出」?

我们已经试过什么(不是伸手党)

联系 / 围观

完整前期包、分镜提示词、评审量表、那 437 个脚本的目录结构,我们都可以开放给认真想交流的人。 这是「AI 工具避坑实验室」的真实一期——这次踩坑的是我们自己。

开放建造日志 · 原样发布 · 我们脱困后会更新这一页。