上周Gemini发布了一个新产品(功能):
Storybook。
用户可以仅通过上传图片或者文本描述即可生成长达10页的故事书(storybook),并且还配有语音朗读功能。

很多人惊呼这东西出来后,会不会慢慢干翻儿童绘本赛道。作为一个有女儿的爸爸,我第一时间体验了下Gemini的storybook。本来第一时间就该写点总结的,但上周沉迷于Claude Code的Vibe Coding和GPT-5测试,耽误了公众号输出。
使用过程非常丝滑,输入指令后不到半分钟,一本画面精美、叙事得当的故事书就呈现在眼前。生成的绘本不仅能匹配阅读年龄,画面风格统一,人物一致性极佳。给人一种直接印刷可用的感觉。

Storybook默认输出为英文,我们可以在提示词中指定为中文输出,也可以指定画面风格,比如我这里指定画面风格为吉卜力风格。



Gemini Storybook体验地址:
https://gemini.google/overview/storybook/
完了之后我又在X上闲逛,看到有大佬(@iguangzhengli)逆向出了Storybook的提示词和所使用的Agent。让我吃惊的是,就这么一个看起来不是很复杂的AI Agent产品,所使用的Agent竟然高达20个!
Storybook所使用的全部Agent包括两大类。
第一类是故事书专用Agent,是用于故事书创作的核心链条,包括:
Writer:故事撰写Agent。主要是根据用户提示词,创作出完整的故事内容。
Storyboarder:分镜脚本Agent。基于完整故事内容,编排故事书每一页的分镜脚本。
NewStorybook:故事书定制Agent。根据用户上传的提示词、图像和视频,创作融入上述信息的个性化图画书。
illustratorSingleCall:插画Agent。为故事书每一页撰写具体的插画指令,保证绘画风格的一致性。
Animator:动画Agent。为故事书每一页生成动画设计,使静态图像页变为动画。(但是我好像没看到故事书有动画功能,存疑)
Photos:照片提取Agent。从用户的谷歌相册中提取图片,用于创作更加贴近用户生活的内容。
第二类是默认Agent,包括搜索、查询、地图、数学、文档读写等十几个Agent,主要用于故事书创作过程中的信息搜集和文档读写。
可以看到,Storybook是一款经典的基于Gemini驱动、Multi-Agent设计的AI Agent产品。从角色分工、内容编排到系统调度,都值得Agent开发者参考学习。
有了初步的使用经验之后,我又加大强度,将我女儿平时的生活照转换为吉卜力风格或者Veo3视频,再用Storybook生成了一套适合我女儿这个年龄阶段的故事绘本。


当夜幕降临,我下班回到家,用电脑打开Gemini Storybook,和女儿在屏幕前一起听AI创作的故事绘本,我想这就是AI发展对于普通人的意义所在吧。
