文章摘要
最新视觉大模型测试结果显示,GPT - 5.6 Sol是表现出色的通用视觉AI。在目标检测、物体计数等任务上有显著提升,如目标检测成绩提升超三倍,物体计数准确率也提高。在文档版面识别、物体密集场景等实际应用中表现突出,但文字识别能力有小幅退步,且存在稳定性问题。与竞品相比,其成本高,视觉大模型性价比竞争才刚开始。

最新的视觉大模型测试结果显示,GPT-5.6系列的Sol版本,堪称当前表现最出色的通用视觉AI之一。

近期,第三方视觉评测机构针对GPT-5.6全系列机型展开了基准测试,测试覆盖了实际落地中最常见的视觉任务:目标识别、物体计数、文字提取以及精准信息抽取。

在核心的目标检测任务中,上一代GPT-5.5仅获得13.8分,这个成绩在视觉模型领域几乎等同于未完成任务;而本次测试的Sol版本直接拿到46.2分,提升幅度超过三倍。同系列的Terra和Luna版本也表现亮眼,得分分别为44.7和43.3;其中定位入门级的Luna,即便成本更低,其检测成绩也远超上一代的旗舰机型。

负责本次测试的机构相关负责人评价称,GPT-5.6 Sol是OpenAI推出以来表现最出色的视觉模型。

物体计数任务的表现同样实现了提升:Sol的识别准确率从GPT-5.5的64.9%提升至73%,Terra和Luna的准确率也分别达到67.6%和66.2%。

具体来看,GPT-5.6系列的核心优势体现在多个实际场景中:

首先是文档版面识别能力表现突出,无论是文档标题、正文段落、表格、插图还是手写签名,Sol都能精准地框选对应区域。对于合同、发票、报表处理这类办公场景来说,这一点至关重要——几乎所有自动化文档处理流程的第一步,都是先定位需要提取信息的板块,再进行后续的文字识别工作。

即便是物体密集的场景,GPT-5.6也能稳定完成任务。比如药片、鸡蛋这类数十个同类物体堆叠的图片,一直是视觉大模型的传统难点:这类场景中,模型需要逐个生成物体的坐标框,物体越多,输出的坐标序列越长,出现漏检、重复框选或者坐标偏移的概率就越高。

更具挑战性的测试中,比如要求模型统计靶纸上指定环数区域内的弹孔数量,Sol也能准确完成任务——它不仅能明确需要统计的目标,还能精准理解规则限定的区域范围,这类精准的空间理解能力是实打实的进步。

不过,GPT-5.6也并非完美,其文字识别能力反而出现了小幅退步:

在整段文字转写任务中,Sol的准确率为90.7%,仅比GPT-5.5的91.2%略低0.5个百分点,差距并不明显;但在定向信息提取任务中,比如从发票中提取指定的日期信息,Sol的准确率仅为82.5%,相比GPT-5.5的87.6%下降了5个百分点。

这并非代表Sol完全无法识别文字:它可以准确转写手写笔记,也能从复杂场景中提取指定的日期信息,甚至能读取脏污轮胎弧面上的印刷尺寸编号,还能按照指定格式提取冰球比赛直播画面中的实时比分。但在面对药板上的有效期文字时,Sol出现了识别失误——这类文字尺寸极小、竖排排列、对比度低且带有反光,成为了它的识别难点。

这种反差也让人颇为意外:一个能精准理解体育直播画面的模型,却在处理日常药品包装上的细节文字时出现了失误。

此外,Sol也存在明显的稳定性问题:在部分高分辨率图片中,模型生成的检测框会偏移到与目标物体无关的区域,和真实物体几乎没有重叠,而且这些错误的框往往排列得异常整齐,比如呈一条直线或者均匀分布。

当测试机构将这类异常样例反馈给OpenAI后,官方给出的解释是:当输入图片的尺寸达到2000×2000像素及以上时,Sol的表现会变得不稳定,且推理档位越低,这种不稳定的情况越明显。

针对这个问题,有两种临时解决方案:一是调高推理档位,虽然能提升稳定性,但会增加Token消耗、推理延迟和使用成本;二是更简单实用的方法:在调用API之前,先将图片尺寸缩小或者裁剪,就能有效避免这类问题。

从使用成本和速度来看,测试机构实测的数据显示:Sol单张图片处理成本约2.5美分,耗时约10秒;Terra约1美分/张,耗时6秒;入门级的Luna成本不到0.5美分,耗时仅5秒。

而竞品Gemini 3.5 Flash的单张处理成本仅0.8美分,比Sol低约三分之二,且在本次基准测试的检测和计数任务中表现依然领先,因此在高频批量的视觉检测任务中,Gemini Flash依然是性价比最高的选择。

总的来说,GPT-5.6 Sol最让人惊喜的突破在于,其视觉能力已经从单纯的“看懂图片”进阶到了“真正完成视觉业务工作”的阶段。目标定位、框选、计数、空间关系理解、文档版面拆分——这类过去专属专用视觉模型的任务场景,正在被通用大模型逐步覆盖。

视觉大模型的竞争已经进入下半场:不再是“能不能看懂图片”,而是“干活的精准度够不够高”。GPT-5.6系列已经展示了强大的视觉能力,但通用大模型在视觉领域的性价比竞争,才刚刚拉开序幕。

以上内容不代表本平台立场,仅供读者参考