本地 LLM
生成故事、视觉、动作和旁白的结构化规格。
从一个孩子的想法,到一本可阅读、可聆听、可播放的完整绘本。六个 Agent 负责策划与评审,用户负责最终决定,DGX Spark 负责本地生产。

真实共创 / 可交付 Reader把儿童表达、家长审核、角色一致性和本地媒体生产分成可治理的环节,而不是把一切交给一次模型调用。
已有完整故事想法时,从一条构想快速开始。用户设置年龄、页数、风格、版本和可选参考图,再进入绘本生产。
孩子分别决定地点、目标、困难和解决办法。AI 可以连接和扩写,但不能替换儿童决定。
每项儿童决定拥有稳定 ID,并通过 sourceContributionIds 追踪到具体绘本页面。

真实界面 / Alina 共创设置
Story Room 产出的是可审核的结构化 Story Draft,而非直接启动媒体生产的自由指令。

真实 Story Room / 路线比较

六角色结果卡

独立年龄与安全评审

视觉评审 / 页面计划证据

真实编辑器 / 贡献追踪

验证后的 Reader 交付
创意阶段使用多智能体;生产阶段使用不可变 RunSpec、确定性 Python Executor、Prompt Compiler 与固定的 ComfyUI Workflow API JSON。
生成故事、视觉、动作和旁白的结构化规格。
角色主卡、封面底图与页面底图。
结合参考图与角色主卡,修正封面和 heroVisible 页面身份一致性。
根据页面图像和 motionSpec 生成逐页动画。
本地普通话旁白推理。TensorRT 只用于 TTS。
装配页面动画、旁白与整书视频。
保存 Prompt ID、Seed、参数、输出路径、探针与 SHA-256。
统一 GPU 资源锁;失败状态持久化,不能冒充成功。
适合比赛现场、家庭、学校与小型内容工作室。
合同不变;Story Room 可响应时,媒体节点执行已审批 Run。

真实父女共创 / 封面拼图

真实 12 页绘本接触表
用于展示媒体生产和 Reader 交付能力的真实素材;Story Room 多智能体证据在前文独立展示,避免混淆 provenance。

不同年龄段 / 角色类型 / 视觉风格

图片 · 有声 · 动态版本 / 4–12 页生产能力
4–12 页严格页数合同;六个年龄段;mustInclude / mustAvoid。
Draft 与 Run 分离;失败状态持久化;新 Draft ID / Run ID 记录重试血缘。
Prompt ID、Seed、SHA-256、原子状态写入与 Reader HTTP 验收。
NeMo Guardrails 管输入输出策略;业务 Contract 与 Validator 管结构与生产约束。
LLM 不能动态发明节点、模型文件和图拓扑;固定 Workflow API JSON 经过验证。
模型输出不合规、探针失败或缓存结果均会阻断阶段,不伪装完成。
| 评分维度 | 占比 | 真实证据 |
|---|---|---|
| 项目实用性、行业价值与技术创新 | 25% | 亲子共创、完整绘本闭环、本地隐私 |
| 智能体融合与模型优化 | 25% | 六 Agent、独立评审、Prompt Compiler、CUDA、TensorRT TTS |
| 项目完整性 | 20% | 前端、API、Agent、媒体生产、Reader、测试与失败恢复 |
| 平台适配性 | 15% | DGX Spark 单机/双机、CUDA、NeMo Guardrails、Stepfun 可选 |
| 演示效果 | 10% | 3 分钟 Demo、完整操作演示、真实绘本结果 |
| 赛事征文 | 5% | Alina 与爸爸共同完成项目的真实过程 |
4 分 30 秒完整操作演示:从首页、共创设置和 Story Room,到用户审批、Reader 交付与多本绘本成果展示。
视频托管于 Bilibili;网页内可直接播放,也可以打开视频详情页观看。