在AI生图领域,GPT-Image-2长期占据着主导地位,其强大的生成能力被广泛认可。然而,近期一款名为Imagine Image 2.0的新模型凭借独特功能引发关注,甚至被马斯克在社交平台X上大力推广,成为行业焦点。
Imagine Image 2.0的独特之处在于其交互性。传统生图模型多依赖提示词控制生成结果,而这款模型支持用户上传图片后进行精准编辑。例如,用户上传一张图片,系统会自动分层,精确识别出图像中的各个元素,如人物、物体等。用户可直接选择特定区域修改,或通过魔棒工具处理自动分层无法覆盖的区域。它还支持多张图片的编辑融合,最多可同时处理5张输入图像,实现自动拼接。
在实际应用中,Imagine Image 2.0展现了强大的创造力。以表情包制作为例,用户上传经典图片后,系统会自动识别对话框、人物等元素。用户只需选择对应气泡框并输入文字,即可生成纵向漫画Meme图。这种分层编辑能力使其在交互友好性上优于GPT-Image-2,后者主要依赖提示词或点选评论控制生成过程。
然而,Imagine Image 2.0也面临争议。部分用户反映其审核机制过于严格,上传蜘蛛侠照片会被提示“无法生成可能包含受版权保护的内容”,擦边内容也受到更强限制。这种“保守”策略虽符合合规要求,却限制了创作自由度,引发部分用户不满。
与此同时,OpenAI被曝正在测试GPT-Image-2的后续版本。有网友在竞技场中发现代号为“mona-lisa-1”的模型,其生成的照片在真实感上有所提升,减少了AI痕迹,更接近手机拍摄效果。例如,在“当代纽约街景”测试中,该模型生成的广告牌、店面等细节更自然,中度思考模式下的AI感明显减弱。
为验证“mona-lisa-1”的身份,网友将其生成图片上传至OpenAI验证工具,结果显示包含SynthID水印,确认出自OpenAI之手。不过,该模型的知识库仅更新至2025年5月22日,在绘制Anthropic发布记录时,Opus 4之后的模型时间线出现错乱,引发对其身份的猜测——可能是GPT-Image 2.0 Mini或开源生图模型。
当前,AI生图领域竞争激烈。GPT-Image-2以综合能力见长,Imagine Image 2.0以交互性突围,而OpenAI的新模型则聚焦真实感提升。随着技术迭代,用户对生图模型的需求从“能生成”转向“生成好”,如何在合规性、创作自由度与技术突破间找到平衡,将成为行业下一阶段的挑战。