7.6
深览指数
产品人人都是产品经理·Timothy··AI 生成
GPT Image 2.5 对比实测:变化与局限
本文通过11类任务、72张输出,实测对比GPT Image 2与2.5在复杂中文图文场景的能力。结果表明,2.5在五组商品信息对应、经营简报数字复现上表现可靠,海报和长规则排版已具实用性。但依然存在工具接触点错误、成品图多出螺钉、图表柱高超出容差、删除任务遗漏倒影等问题,中文书法仅呈现风格差异而非水平提升。文章逐一拆解成功与失败样本,提供了判断模型是否值得升级的具体检查清单,适合正在评估AIGC辅助设计/排版落地效果的产品或运营人员阅读。原文 ↗
核心观点
- ▍GPT Image 2.5 在复杂中文图文排版(商品信息对应、多区域数字一致)上已有实用价值,但在精确工具接触点、零件数量核对、图表比例和误删逻辑上仍不稳定,不是全面升级模型。
- 01五组商品(冷热/容量/价格)的海报指令,两代模型的六张输出均对应正确,2.5 将三条规则并排底部偏离了提示词要求的“三行排法”,但内容完整。
- 02安装说明任务中,2.5 第三次在四颗螺钉之外又画出了第五个红色钉位,且扳手下方多出钉位;第二次将“四根柱连接上下板”改为悬空装配示意。
- 03经营简报柱图中,2.5 第三张的五月柱数字写24,量出的高度约为25.5,超过预设的3%容差;上一代三张均在容差内。
- 04删除红衣人物及其玻璃倒影的测试中,2.5 三次只有最后一次全部清除,前两次留下完整红衣倒影。
- 05行书样本 2.5 墨迹偏饱满,上一代有更多飞白;草书中2.5更常保留完整结构,上一代省变更多,未发现2.5的书法水平更高。
- 06连续编辑(换沙发/茶几/加落地灯)和参考人物换动作任务中,两代各有瑕疵,2.5未显示稳定领先。
反方 / 局限
- — 本文结论来自72张样本,未做多评委盲评,实际生成设置差异(如seed、采样参数)可能影响结论普遍性。
- — 作者承认经营简报中的数字已在提示词中给出,只能确认复现与对应,无法推断模型自行完成了计算或推理。
- — 部分任务(如连续编辑的墙面纹理、密集人群中的远端面孔)作者自己也未做逐指标准确率统计,所以仍存在“看起来可以但经不起细查”的风险。
9 分钟 · 4 卡片 · 11 资料
读原文 →