晓|OpenAI GPT-4o图像生成技术解读:人人都能当 “神笔马良”!
旺晓通:深入浅出解读,轻松通晓技术
最近,AI 界可是热闹非凡,OpenAI 搞了个大事情,在 ChatGPT 里推出了 GPT-4o 图像生成功能。这一出手,就像在平静的湖面上投下了一颗重磅炸弹,直接把大家对 AI 的认知又拉高了好几个档次。今天咱就来唠唠,这个 GPT-4o 图像生成到底是何方神圣,它又是怎么做到让人眼前一亮的。

作者:张长旺,图源:旺知识
一、GPT-4o图像生成是什么?和以前有啥不一样?
以前要是想用ChatGPT生成个图片,它得借助像DALL·E 3这样单独的扩散模型。这就好比你想做饭,但没有一体化的厨房电器,得从这个房间拿个锅,再从那个房间找个炉灶,用起来不太方便。而且,DALL·E 3在生成图片的时候,问题还不少。比如让它在图片里写点能看得懂的文字,简直比让小朋友写一篇完美作文还难;遇到复杂点的指令,它就像迷路的小猫,晕头转向,根本不知道该怎么办;要是让它修改图片,前面改了啥,后面就忘得一干二净,完全没有“记忆”。
GPT-4o可就不一样啦!它把图像生成功能直接融合到了模型里,就像把厨房的各种电器都集成到了一起,用起来那叫一个方便。“GPT-4o”里的“o”代表“omni”,意思就是它能像个全能小助手一样,同时处理文本、图像、音频这些不同类型的信息。现在,你想让ChatGPT生成图片,不用再费那么多周折,在聊天框里直接描述你想要的画面就行,不管是简单的小图标,还是复杂的大场景,它都能试着给你画出来,就像有个专属的小画师时刻待命,随叫随到。
二、GPT-4o图像生成是怎么实现的?
GPT-4o图像生成的背后,其实用到了先进的语言建模和图像合成技术,这里面的门道有点复杂,咱就用个简单的例子来说明。
想象一下,你要给一个从没去过你家的朋友描述你家的样子,好让他能画出你家的房子。你会怎么说呢?你可能会先描述房子的整体形状,像“我家房子是方方正正的,有两层”,这就好比GPT-4o用语言理解能力来解读你输入的图像提示。然后你会接着说“房子有个大大的红色屋顶”“门口有个小花园,种着五颜六色的花”,一点点把细节补充完整。
GPT-4o也是这样,当你输入一个图像提示,比如“一只猫在纸箱里”,它先用自己的“语言大脑”理解这个提示,然后通过一种叫Transformer的网络,把这个提示转化成一种类似图像密码的东西(专业点叫视觉表征,像图像令牌或者潜在代码),这就相当于它在心里勾勒出了一个模糊的图像轮廓。
接下来,就要把这个模糊的轮廓变成真正能看到的图像。这时候,一个像“神奇画笔”一样的东西——滚动扩散解码器就派上用场了。它不会一下子把整个图像画好,而是像拼图一样,把图像分成一块一块(比如分成水平的条带),然后一部分一部分地慢慢画。每画一部分,就像在一幅原本模糊的画上,一点点擦去模糊的地方,让画面变得更清晰。而且在画的过程中,它还会不断参考之前生成的“图像密码”和你输入的文字提示,就像你在画画的时候,时不时看看参考照片,确保画得更像。最后,把这些画好的部分拼在一起,一幅完整的、高清的图像就诞生啦!是不是感觉很神奇?

事实上OpenAI团队在一块白板上画了一幅涂鸦,暗示了这一点:“tokens -> [transformer] -> [diffusion] -> pixels.” 。这幅图向我们展示了 GPT-4o 在图像生成方面的整体架构改进。
GPT-4o图片生成流程可以用如下流程表示:
用户提示(例如,“一只猫在一个纸箱里”)───────────────────────────────────────1. 文本编码 • 多模态Transformer编码器 → 输出密集的文本嵌入向量2. 自回归Transformer(解码器) • 接收文本嵌入向量 • 生成视觉标记(在潜在空间中) - 以自回归方式 - 按从上到下、从左到右的顺序 → 结果:图像的压缩视觉规划3. 滚动分组扩散解码器(ROLLING GROUP-WISE DIFFUSION DECODER) • 图像被划分为N个组(例如,水平条带) • 每个组使用扩散方法逐步解码 - 从噪声开始 - 运行K步 - 每次对1个组去噪 ↳ 在每一次扩散步骤中(针对每个组): ↳ 交叉注意力: • 针对视觉标记(潜在指令) • 针对文本嵌入向量(语义)4. 最终图像 • 所有组拼接在一起 • 输出:像素空间中的高分辨率图像 ───────────────────────────────────────
三、GPT-4o图像生成有哪些厉害的地方?
(一)超强的记忆力
以前的图像生成AI就像金鱼,记忆只有七秒,你和它说点啥,它转头就忘。但GPT-4o不一样,它就像个记忆力超好的小机灵鬼。你可以和它来回交流修改图片,它能清楚地记得自己刚才画了啥,你又提了哪些修改意见。比如你让它画一只猫,然后又说“给猫加个蝴蝶结”,它能准确地在刚才画的猫身上加上蝴蝶结,而不是像以前的AI一样,又重新画一只全新的猫。
(二)支持反复修改
要是对生成的图片不满意,没关系!你可以像给设计师提意见一样,给GPT-4o反馈。不管是让它把图片变成表情包风格,还是换个背景颜色,又或者调整某个物体的大小、去掉图片里的文字,它都能根据你的要求,生成修改后的新图片,而且修改得还挺像那么回事儿。
(三)能听懂复杂指令
GPT-4o理解复杂指令的能力超强,就像一个聪明的学生,老师说再多要求,他都能记住并且做好。以前的AI遇到复杂指令就像听天书,但是GPT-4o不一样。你要是让它画“一个在海边度假的场景,有蓝天白云、金色沙滩、蓝色大海,沙滩上有一把遮阳伞,伞下有一个人在喝果汁,远处还有几艘帆船”,这么长一串复杂的要求,它也能准确理解,然后画出符合你要求的精美画面。
(四)图片里的文字超清晰
以前的图像生成AI在图片里写文字,就像小学生写字歪歪扭扭,根本看不懂写的啥。但GPT-4o在这方面简直是个“学霸”,不管你是要它画个带文字的招牌、海报,还是写着公式的黑板,它都能写得清清楚楚、明明白白,文字就像印刷上去的一样。
(五)能利用上传的图片
GPT-4o不仅能自己凭空画画,还能像个善解人意的小伙伴一样,根据你上传的图片来创作。比如你上传一张自己的照片,让它把你P到一个美丽的风景里,或者以这张照片为灵感,创作一幅新的画,它都能轻松做到。
(六)风格多样,超逼真
GPT-4o就像一个多才多艺的艺术家,啥风格都能驾驭。它看过各种各样的图片,经过大量的“学习”,不管你想要逼真得像用相机拍的照片,还是充满童趣的卡通画、文艺的水彩画,又或者是简洁的素描,它都能模仿得惟妙惟肖,满足你各种奇奇怪怪的创意需求。
四、大家都用GPT-4o图像生成来做什么?
(一)设计和原型制作
对于搞设计的人来说,GPT-4o就像一个超级好用的设计神器。比如说做APP或者网页设计,以前做个原型,设计师得花好多时间手绘草图,再一点点用软件制作。现在有了GPT-4o,只要在聊天框里输入“生成一个图像放大应用的UI/UX模型”这样的提示,它马上就能给出一个看起来专业又精致的设计,里面有上传图片的框、操作按钮、示例图片,整体设计简洁又大方,就像专业设计师花了好长时间做出来的一样。

Prompt – generate a UI/UX mockup for my image upscaler app
要是做美食外卖软件的设计,它也能快速生成一个包含订单、顾客、分析等功能模块的界面,这效率,简直高到飞起!就算你想要更个性化的设计,比如参考某个化妆品网站,为现代面包店设计一个主页,它也能根据你的要求,替换图片、保持风格,生成一个超棒的网站图像。

Prompt – generate a UI/UX design for my food delivery SAAS
在平面设计方面,它也毫不逊色。让它画一个“如何在巴黎生活”的四格漫画海报,它能按照要求,用鲜明的色彩、简洁的线条画出有趣的画面,每个格子都配上幽默的文字说明,就像专业漫画家画的一样。

Prompt –Create a 4-panel comic-style poster titled ‘How to Live in Paris’ in bold red letters at the top. Use a light beige background and a clean cartoon illustration style. Each panel should have a blue background and feature the following:
Top-left panel: A fashionable woman wearing a red beret and black-and-white striped shirt, hand on chest, looking dramatic. Caption: ‘1. Dress fancy’.
Top-right panel: An annoyed Parisian man glaring at two confused tourists holding a camera, a map, and a drink cup. Caption: ‘2. Loathe tourists’.
Bottom-left panel: A person happily biting into a large baguette. Caption: ‘3. Eat baguettes’.
Bottom-right panel: A woman holding a glass of red wine with a stern expression. Caption: ‘4. Be unimpressed’.
Use expressive cartoon faces and minimalistic details to emphasize humor.
要是让它设计一个80年代风格的阿迪达斯创意广告,它也能抓住那个年代的风格特点,创作出让人眼前一亮的作品。

Prompt – Creative ad from the 80s, Adidas [insert – input reference image]
(二)创意艺术、表情包和视觉故事创作
在社交媒体上,GPT-4o可是个“网红”。大家用它来创作各种有趣的图片,玩得不亦乐乎。有人让它生成一个90年代杂货店的监控画面,画面里一个穿着中世纪盔甲的人在偷烤鸡,还得有运动模糊和VHS录像带那种色彩失真的效果,它居然真的画出来了,而且画面荒诞又有趣,充满了想象力。

Prompt – a security cam still from a 1990s grocery store showing a man in full medieval armor stealing rotisserie chickens, frozen in mid-sprint past the dairy section… timestamp reads ‘08/13/96 04:44 AM’… motion blur adds chaotic energy, absurd yet intense, low-fidelity with VHS color bleed.
还有人把它当成制作表情包的神器,用它生成各种著名虚构角色的搞笑场景,或者把普通的图片变成吉卜力工作室风格的动漫图片,瞬间就让图片变得高大上起来。

Prompt – make it into a Studio Ghibli-style anime [insert the original meme image]

要是你想拥有一张逼真的虚构学位证书,或者想看两个女巫在充满奇怪路牌的纽约街头的有趣画面,它也能满足你,画出来的效果逼真得让人惊叹。

Prompt – Generate a photorealistic Bachelor’s degree in [DEGREE] from [UNIVERSITY] awarded to [NAME] with honors, including the official seal, president’s signature, and security features, photographed hanging on a wall. [INSERT IMAGE: Photo Reference of a Degree]

Prompt – a photorealistic image of two witches in their 20s (one ash balayage, one with long wavy auburn hair) reading a street sign.
Context: a city street in a random street in Williamsburg, NY with a pole covered entirely by numerous detailed street signs (e.g., street sweeping hours, parking permits required, vehicle classifications, towing rules), including few ridiculous signs at the middle: (paraphrase it to make these legitimate street signs)”Broom Parking for Witches Not Permitted in Zone C” and “Magic Carpet Loading and Unloading Only (15-Minute Limit)” and “Reindeer Parking by Permit Only (Dec 24–25)\n Violators will be placed on Naughty List.” The signpost is on the right of the street. Do not repeat signs. Signs must be realistic.
Characters: one witch is holding a broom, and the other has a rolled-up magic carpet. They are in the foreground, back slightly turned towards the camera and head slightly tilted as they scrutinize the signs.
Composition from background to foreground: streets + parked cars + buildings -> street sign -> witches. Characters must be closest to the camera taking the shot.

Prompt – Make it into a voxel-3d style art. [INSERT IMAGE: Photo Reference]

Prompt – Make it into a Disney Pixar-style art.[INSERT IMAGE: Photo Reference]

Prompt – Make into a van-gogh style art. [INSERT IMAGE: Photo Reference]
(三)商业、营销和教育应用
在商业和营销领域,GPT-4o也发挥了大作用。营销人员可以用它制作信息图表、广告海报。比如生成一个展示人工智能艺术发展历程的复古风格信息图表,它能把复杂的信息用有趣的画面展示出来,让观众一眼就能看明白。要是想做个产品广告,只要给它一些提示,它就能生成吸引人的海报,甚至还能和视频生成技术结合,制作出完整的视频广告。

Prompt – An illustrated infographic chart showing the evolution of AI-generated art. The style is vintage, hand-drawn, and whimsical with warm colors and textured paper background. Include the following labeled visual elements:
‘Early AI Art’ with a pixelated face.
‘Style Transfer’ leading to a Van Gogh-style portrait.
‘Prompt-Based Generation’ connected to logos of Midjourney, Stable Diffusion, and Runway.
‘Inpainting’ shown with a classic Mona Lisa transformed into a modern room scene.
‘Text-to-Image’ with an astronaut hugging a cat and a ‘castle on a cliff’ appearing from a prompt box.
‘Image-to-Image’ with two jars containing landscape paintings, one evolving into the other.
Logos of tools like DALL·E, OpenAI, Flux.
Use flow arrows to show transitions and processes. Keep the aesthetic playful, educational, and artistic.
在教育方面,老师们可喜欢它了。它可以画牛顿棱镜实验的详细图解,还能画出一个人在笔记本上画这个图解的场景,就像给教材配上了生动的插图。要是给大学设计一个动漫风格的教育海报,它能把温暖、阳光的场景和大学的信息完美融合,让海报充满吸引力,激发学生的学习兴趣。

Prompt – an infographic explaining newton’s prism experiment in great detail

2nd Prompt – now generate a POV of a person drawing this diagram in their notebook, at a round cafe table in washington square park.

Prompt – Draw a simple whiteboard diagram of the human brain and its parts and functionality in great detail.

Prompt – An anime-style boy with brown hair and expressive eyes is sitting at a wooden table in a cozy, sunlit room. He is smiling excitedly while holding a modern smartphone in his hand. On the table in front of him, there’s a visible tablet and a second large smartphone screen, standing upright and showing a website about “OpenCV University” [take the given as a reference Image screenshot]. The setting includes a window showing a blue sky with fluffy clouds, and the overall art style resembles Studio Ghibli animation, with warm tones and soft shading.
五、GPT-4o虽好,但咱也得悠着点
虽然GPT-4o图像生成功能超级厉害,但就像所有强大的工具一样,它也带来了一些问题。因为它能生成超级逼真的图片,包括真实的人物、商标等等,这就引发了一些道德方面的担忧。比如说,有人可能会用它伪造证件、制作虚假广告,这可就麻烦大了!
为了防止这些情况发生,OpenAI也采取了一些措施,比如在生成的每张图片里都悄悄藏了一个“小标记”(C2PA元数据),就像给图片贴上了一个隐形的“AI制造”标签,这样大家就能知道这张图是不是AI画的啦。所以咱们在享受GPT-4o带来的便利和乐趣时,也要遵守规则,不能乱来哦!
GPT-4o图像生成技术就像一场及时雨,滋润了各个领域,给我们的生活和工作带来了超多惊喜和便利。不管你是设计师、创意工作者,还是营销人员、老师,甚至只是一个喜欢玩AI的普通网友,都能从这个功能里找到无限乐趣和可能性。赶紧去试试给GPT-4o一些创意提示吧,说不定它画出来的东西会让你大吃一惊!

作者:张长旺,图源:旺知识