27.03.2025
OpenAI 集成了 Images in ChatGPT 功能,允许用户通过 GPT-4o 模型的强大功能直接在聊天机器人中创建图像。
3月26日,OpenAI表示,ChatGPT中Images的首次发布主要侧重于图像创建,可供Plus、Pro、Team或免费订阅包的用户使用。此前,ChatGPT 允许通过 Dall-E 模型创建照片,该模型功能有限,每天仅允许三张免费照片。
在社交网络上,许多人尝试过,并对这个新工具表示惊讶。 “栩栩如生的图像让我感到惊讶。如果不是注明这是一张人工智能照片,我可能都不会意识到。它的质量优于我之前体验过的图像创建工具,”Facebook 帐户 Hoang Vy 说道。 “在不久的将来,你在网上看到的图像可能不是真实的,”Cong Tam 账户说,而 The Ha 账户则评论道:“也许平面设计师和照片编辑将不得不升级自己以使用人工智能,否则就会失去工作。”

边缘 OpenAI 发言人 Taya Christianson 表示,免费版本的功能有限,但仍将优于 Dall-E。
首席研究员 Gabriel Goh 表示:“与之前的模型相比,新功能向前迈出了一大步。”他补充说,他的团队使用多模态平台 GPT-4o(OpenAI 最强大的语言模型之一)来实现 ChatGPT 的成像功能。
Goh 表示,ChatGPT 使用 GPT-4o 的图像生成能力的显着改进称为“绑定”——这个术语指的是 AI 图像生成器在属性和对象之间保持精确关联的程度。例如,给定蓝色星形加红色三角形的提示,对齐不良的图案仅产生红色星形而没有三角形。 Goh 表示,大多数图像模型都在努力解决这个问题,如果同时收到多个请求,通常会混合颜色和形状。
“带有 Binding 功能的新可视化引擎可以准确地绑定 15-20 个对象的属性,不会造成混淆,从而证明了准确性和可靠性的显着提高,”Goh 说。
ChatGPT 上的图像生成器还改进了图像中文本的显示,有助于创建更加连贯且不“扭曲”的文本。 Goh 表示,这也是一个重大挑战,因为如果标题或文本元素有错误,整个图像就无法使用。
此外,新工具使用自动回归方法,从左到右、从上到下顺序创建图像,类似于书写文本,而不是大多数成像仪使用的扩散建模技术。这种技术差异使得 ChatGPT 中的图像能够更好地渲染和链接图像中的文本。
“这是一个迭代过程,需要数月才能完善,”吴强调。他补充说,虽然并不完美,但 ChatGPT 上的图像创建功能“已经达到了所创建产品的质量可用的程度”。
在新功能演示中,OpenAI 展示了几个展示 ChatGPT 无缝成像功能的示例,例如带有精确标记的颜色分量的牛顿棱镜实验的科学图;具有一致人物和对话气泡的多面板漫画;或贴纸、徽标和餐厅菜单的透明背景。

然而,与其他模型相比,ChatGPT 中的图像创建图像所需的时间更长。 ChatGPT 多模式产品经理 Jackie Shannon 表示,这是“值得权衡的”。
“我们肯定会改善延迟,但现有的生成图像的能力,它生成的图像的质量确实可以弥补额外的等待时间,”香农在博客中写道。
关于创建虚假裸照的风险……,Shannon 表示 ChatGPT 中的图像具有强大的保护功能,可以防止色情 Deepfake 内容并拒绝“欺诈”请求,但没有提及细节。生成的图像还集成了 C2PA 标准元数据,将其标记为由 AI 创建,可以使用检测工具进行查找。
“当然,没有一个系统是完美的,但我们不断改进我们的保护措施,”香农补充道。
宝林 (根据 The Verge、TechCrunch 报道)