一直被吐槽"只会看图、不会干活"的GPT系列,这次总算在视觉上支棱起来了。第三方机构Roboflow的实测显示,GPT-5.6旗舰版Sol的目标检测得分是上一代的三倍还多,但反向的槽点也随之而来:认字反而变笨了。
如果你常拿大模型处理图片,多半见识过GPT在视觉上的尴尬。让它在一张图上把每个物体框出来,它常常框得七零八落。但Roboflow最新一轮基准测试,把这一局面彻底改写。
这家专门做视觉评测的机构,把GPT-5.6的"全家桶"——旗舰Sol、中端Terra和轻量Luna——全部拉进自家的视觉模型测试集,考察的都是最实在的能力:找东西、数个数、认文字、抽信息。
一场让GPT翻身的"视觉考试"
目标检测一直是GPT系的短板。上一代GPT-5.5在这个项目上只拿了13.8分,在视觉圈里基本等于白卷——它大概知道图里有东西,至于框框画在哪,全靠猜。这次Sol直接把分数抬到46.2,三倍多的涨幅,连Roboflow的项目负责人SkalskiP都忍不住评价:这是OpenAI有史以来最强的视觉模型。
更值得玩味的是,紧随其后的Terra和Luna分别拿到44.7和43.3。其中Luna是这一代里最便宜的档位,可它的检测得分照样把上一代旗舰按在地上摩擦。计数方面也同步上涨,Sol的准确率从上一代的64.9%爬到73%,Terra和Luna分别是67.6%和66.2%。
画框、数数、拆版面,全都能打
最亮眼的提升在文档版面识别上。标题、正文、表格、插图、签名,Sol都能干净利落地圈出来。对做合同、发票、报表流水线的人来说,这一步几乎决定了后面所有环节能不能跑起来——毕竟任何文档处理的第一步,都是先搞清楚"该看哪一块"。
密集场景也扛住了。药片、鸡蛋这类几十个同款物体挤在一张图里的画面,向来是视觉模型翻车的重灾区,因为大模型画框是一个坐标一个坐标往外打数字,物体越多输出越长,漏框、重框、坐标跑偏的概率就越高。更刁钻的还有"数弹孔":一张靶纸上,只让模型数落在指定环数区域里的弹孔,Sol直接做对了——它不但知道要数什么,还知道规则管到哪一圈为止。
最反常识的退步:认字居然变笨了
分数涨归涨,可Sol的识字能力是实打实往后退了。整段OCR转写它拿90.7%,和上一代的91.2%只差半个点,基本可以忽略;但"定向提取"这项——不要全文,只要某一条信息,比如把发票上的日期单独揪出来——Sol只拿下82.5%,比上一代的87.6%掉了5个点。
它倒也不是彻底不认字:手写笔记能整段转写,脏轮胎弧面上印的尺寸编号也读得出来,冰球直播画面里的实时比分还能按指定格式吐出来。真正翻车的,是药板上那行有效期——字小、竖排、低对比度、还反光。于是出现了荒诞的一幕:一个能读懂比赛转播画面的模型,却读不出你手里那盒药什么时候过期。
一张大图,就能让Sol"画歪"
Roboflow还发现,Sol在部分图片上会框出跟真实物体几乎零重叠的区域,而且这些框排得异常整齐——一条直线,或者均匀分布的一组。他们把样例发给OpenAI,得到的答复很干脆:图片尺寸到了2000×2000像素左右或更大时,Sol会变得不稳定,推理档位调得越低越不稳定。
解法有两个。一是把推理档位调高,稳是稳了,但token消耗、延迟和账单全都跟着涨;二是最土也最有效的办法——发给API之前,先把图缩小或者裁一刀。
性价比的账,算下来还是有悬念
Roboflow还测了真金白银的成本:Sol大约2.5美分一张、耗时约10秒;Terra约1美分一张、6秒;Luna不到0.5美分一张、5秒。而谷歌的Gemini 3.5 Flash每张只要0.8美分,比Sol便宜三分之二,检测和计数在这套基准上还继续领先。真遇到高频、大批量的检测计数任务,Gemini Flash依然稳坐"性价比之王"。
所以综合来看,GPT-5.6 Sol这轮最让人意外的地方,是视觉能力正从"看懂一张图",跨进"真正干视觉的活"——找目标、画框、计数、理解空间关系、拆文档版面。这些过去更像是专用视觉模型的地盘,如今正被大模型一点点蚕食。视觉大模型的下半场,已经从"能不能看懂"卷向了"干活准不准"。GPT-5.6亮出了肌肉,但性价比的战争,才刚刚开打。
免责声明:本文基于公开报道的事实信息整理,仅供参考,不构成任何投资或技术选型建议。
发表评论 取消回复