J-Space称V4 Pro超Fable 5,实测反降遭删帖

近期一款名为J-Space Cognition Suite V3.6的工具在AI社区迅速引发关注,其发布方声称只需通过一个简单的Skill接入Agent运行环境,就能让DeepSeek V4 Pro的性能实现大幅跃升,不仅在多个基准测试中取得亮眼成绩,部分指标甚至超越Fable 5,同时还能提升两倍以上的运行速度与Token使用效率。但仅仅没过多久,这项宣称就遭遇了社区的公开打假。
爆红的性能提升与实测打脸
据介绍,J-Space是一套与模型无关的推理时控制方案,无需修改模型权重或进行微调,仅以Skill的形式接入Agent运行环境。项目作者将Agent常见的运行失控问题归纳为四类:一是工作集过载,当任务同时塞入过多目标、限制与工具信息时,核心内容会被淹没;二是表征漂移,名称、数值或任务目标在多轮推理和跨文件处理中逐渐发生偏差;三是无效重试,工具调用失败后未保留诊断信息,直接沿原有路径重复执行;四是过早完成,模型仅凭流畅的回答就判定任务结束,未验证结果可用性。这些问题在长程Agent任务中尤为突出。
为解决这些问题,J-Space试图构建一套更稳定的执行循环:先进行短判断,再执行操作、深入推理并验证结果,遇到问题时带着诊断信息恢复执行。同时,它会限制当前工作区的活跃内容,将关键目标、已验证信息、未解决问题和下一步操作写入外部账本,避免模型在执行过程中迷失方向。
根据项目配套的能力释放报告,接入J-Space后,DeepSeek V4 Pro的Terminal Bench成绩从87.9提升至90.1,NL2Repo指标从61.5跃升至73.4,DeepSWE得分从62.7提高到72.0。按照这份报告的数据对比,V4 Pro在部分Agent与编程基准测试中甚至超越了Fable 5和Opus 4.8。
但很快就有开发者对这份成绩提出了质疑。最早的负面测试结果来自项目仓库的Issue #10,一位开发者使用V4 Flash进行了两轮A/B测试,覆盖数学推理、代码生成、仓库开发和中断恢复等任务。在第二轮实验中,对照组与J-Space组各运行3次,总计12次测试。结果显示,两组的任务完成度没有明显差异,反而J-Space组消耗了更多的Token资源。在第三方盲评中,对照组的平均得分为8.30,而J-Space组仅为7.87。
随后出现了更直接的对比结果。用户Jyleaves在Issue #26中表示,自己使用8张NVIDIA H20部署V4 Flash,通过DeepSeek Harness Standard模式加载J-Space进行测试。在89道测试题中,模型通过69道,最终得分为77.5%,但J-Space报告中给出的对应成绩为87.1%。测试者还表示,失败任务至少重新运行了3次,仍未得到报告中的提升效果,因此质疑项目数据的真实性,并要求作者公开完整的评测环境、测试流程和样本输出。
更引发争议的是,有开发者在Issue #23中称,自己此前发布的质疑帖遭到作者删除,只能重新发帖备份。这一操作也被不少网友认为是“欲盖弥彰,不打自招”,让原本的性能宣称彻底演变为一场公开的打假事件。
迷惑性的切入点
事实上,J-Space的迷惑性恰好在于它踩中了DeepSeek V4 Pro最受关注的痛点:对外部运行环境过于敏感。从V4 Pro正式发布以来,不少用户都发现,在不同调用条件、不同用户环境下,模型的表现差异巨大。比如有用户在正式版发布当晚,用相似的提示词两次测试3D直升机游戏项目,凌晨0点50分生成的结果还较为粗糙,不到四小时后就产出了完整得多的项目。网友猜测这类差异可能来自模型之外的因素,比如测试框架Harness。
在一个名为Project2的工程任务中,同一台V4 Pro在DeepSeek Harness的Standard模式下得到91分,PTC模式为92分,切换到工具更少的Minimal模式后,两次测试分别拿到了99分和96分。模型和任务本身没有变化,仅外部运行环境的调整就带来了接近8分的成绩差距。
针对V4 Pro的环境敏感性问题,此前已经出现了不少针对性的优化方案。比如Routing Suite会根据任务类型选择对应的推理模式,避免模型在简单任务上过度思考、复杂任务上过早行动;Anchored Standard则聚焦于首次模型请求,先用简短提示和少量工具让模型进入稳定轨迹,再开放完整的工具能力。
J-Space正是借用了这类真实存在的行业痛点,让“性能大幅提升、超越竞品”的宣称看起来顺理成章,才能在短时间内传遍社区。但正如行业共识所言,能被复现的提升才是真正的性能提升,拿不出完整验证过程的成绩,数字越惊人,越需要先打上一个问号。

