Appearance
GPT-Image2提示词写法变了:从"帮我画一个"到"帮我做一个"
掌握新写法的人,正在用GPT-Image2出产品、做设计、做内容。没掌握的人,还在"帮我画一只猫"。
GPT-Image2爆了,火爆的爆。
我在被各种「神图」刷屏之后,特地去翻了一个GitHub仓库——awesome-gpt-image-2-prompts,收集了117条提示词案例。
翻完之后有一个特别强烈的感受:
大部分人用GPT-Image2的方式,和在Midjourney上写prompt没什么本质区别。「帮我画一只穿宇航服的猫」,「生成一个赛博朋克风格的城市场景」——描述需求,等它出图。
而另一拨人,已经开始用JSON格式写提示词了。
从"帮我画一个"到"帮我做一个"
GPT-Image2最夯的能力,是它对结构化需求的理解力。是它对真实世界的理解,好像第一次达到了以假乱真。
JSON结构化Prompt示例
json
{
"type": "直播 UI 样机",
"subject": {
"description": "Elon Musk 的肖像,面带微笑",
"background": "左侧显示 SPACEX 屏幕,右侧显示 Tesla logo"
},
"ui_overlay": {
"top_header": {
"host_info": "头像,名称 Elon Musk,副标题 55.6万本场点赞",
"viewer_stats": "总计 68.7万"
},
"bottom_left_chat": {
"messages": [
"小火箭: 马斯克!未来可期!",
"AI探索者: Neuralink进展如何?"
]
},
"bottom_right_product_card": {
"title": "特斯拉Cybertruck 电动皮卡",
"price": "¥ 1,618,000"
}
}
}它直接给你出一张完整的抖音直播截图:
- 弹幕是你要的内容
- 商品卡片是你指定的商品
- 连点赞数和在线人数都是你在JSON里写的那串数字
区别有多大?
以前是描述一下「画一个直播界面」,现在是给一份规格说明让它「构建」一个直播界面,每个元素都按你的定义落地。
你给了它结构,它按结构来拼装。这和「我描述一下你帮我画」的逻辑完全不同。
一句话能出什么?
JSON Prompt是最高精度的用法。但GPT-Image2的理解力远不止此,有些案例只需要一句话,出来的东西就能让你愣住。
宋朝人的朋友圈
有人在X上发了一句「生成宋朝人的朋友圈」。
结果出了苏东坡的朋友圈:
- 头像、用户名、配图、评论区全齐了
- 评论区里王安石回了个「呵呵」,司马光说「还是那个味道」
- 点赞列表是黄庭坚、秦观、佛印等126人
- 状态栏显示「大宋移动5G」,年份「元丰三年」
这创意太绝了。
还有人试了「玄武门之变的朋友圈」,历史事件变成了社交媒体信息流。
慈禧的X主页也有人做出来了,头像、简介、推文一应俱全。
一句话出UI设计系统
UI设计师@pfanis发了一句:
帮我生成一套 UI 设计系统,包含网页、移动端、卡片、控件、按钮以及其它出来了一套完整的glassmorphism风格设计系统:Dashboard、移动端、组件库全有。
一个人,一句话,出了一套设计师可能要花两天做的活。
ARPG游戏原型
op7418用GPT-Image2 + 字节的Seedance 2.0做了一个ARPG游戏《金瓶梅》的动态演示:
- 游戏UI交互
- 画面衔接
- 台词全部AI生成
续作《黑神话:林冲》效果更好,他说「所有交互UI全都是动的,要不是涂抹感真看不出来」。
三个值得说的提示词技巧
117个案例翻下来,有三个技巧值得单独拎出来说。
技巧1:参考图 + 文字组合
这个可能很多人知道但没当回事。
上传一张参考图配合详细文字描述,比纯文字提示词效果好一大截。
品牌设计、IP周边这类需要保持一致性的场景,上传参考图几乎是必选项。你不需要描述得多精确,但需要给AI一个锚点。它知道你要的「那个感觉」是什么之后,后面的一切都变得更可控。
技巧2:在Prompt中内嵌「研究」过程
这个是我觉得最意外的。技巧来自@old_pgmrs_will。
你可以在提示词里直接写:
先研究 Bauhaus 设计运动的核心理念,然后基于其几何构图和色彩理论,设计一套现代科技产品的品牌视觉系统它真的会先「研究」再出图。
以前的AI图像生成需要你自己做完设计研究再把结论喂给AI,现在这一步直接塞进提示词里就完事了。
查资料和出图,两步并一步。
技巧3:JSON结构化Prompt
直接给你一个最小可用的模板:
json
{
"type": "你要生成的图像类型",
"subject": {
"description": "主体描述",
"background": "背景描述"
},
"layout": {
"sections": [
{"type": "区域名称", "elements": ["元素1", "元素2"]}
]
},
"style": "整体风格描述"
}从这个模板开始,比写「帮我画一个XX」出图精准得多。
JSON强迫你把需求想清楚:类型、主体、布局、风格,每一项你都得更明确地定义。
它本身没有魔力,但它逼你做了一件你之前一直在偷懒不做的事——把需求想透。
局限:编辑很"固执"
坦率的讲,GPT-Image2仍然有明显短板。
@emollick指出它的编辑很「固执」,改几轮后进展变慢,开新对话有帮助。如果你在做需要反复迭代的设计项目,这个固执会浪费你不少时间。
另外,JSON Prompt再精确,输出的依然是图片,不是代码。你不能直接拿去当前端用。
它更适合做:
- 概念验证
- 提案展示
- 内容创作
小结
提示词的写法确实已经变了。
我翻到那些JSON prompt的时候反应了好一会儿,因为这事儿历史上发生过。最早的编程语言COBOL被设计成「像英语一样」,大家觉得用自然语言写代码多方便啊。
结果呢,结构化的形式语言比自然语言精确得多、可靠得多。
提示词正在走同一条路。
掌握新写法的人,正在用GPT-Image2出产品、做设计、做内容。没掌握的人,还在「帮我画一只猫」。
试试那个JSON模板吧。从一个最简单的UI mockup开始。
关键词:GPT-Image2, 提示词技巧, JSON Prompt, 结构化提示词, AI画图
