文章摘要
近期大模型领域更新加速,多款新模型上线。为评估模型实际落地能力,对Kimi K3、GLM - 5.3、DeepSeek - v4 - pro三款主流编码大模型进行横评,从任务完成度与输出质量两维度,覆盖四类编码场景。结果显示,Kimi K3综合实力突出,GLM - 5.3次之,DeepSeek - v4 - pro逊色,且生成速度与产出质量不成正比。

近期大模型领域更新频率再次加快,多款新模型扎堆上线,官方跑分数据看起来十分亮眼,但实际落地表现才是评判模型实力的核心标准。我们选取了三款近期发布的主流编码大模型——Kimi K3、GLM-5.3以及DeepSeek-v4-pro-0813,通过统一测试标准进行横向对比评测。

本次评测严格遵循变量归一原则,所有模型均通过官方API接入统一开发工具,使用完全相同的提示词和测试任务,从任务完成度与输出质量两个维度进行综合评分。测试覆盖前端网页开发、3D场景搭建、官网设计、网页游戏开发四类典型编码场景,全面评估模型的代码生成与落地能力。

前端网页开发测试

本次测试重点考察模型的审美水平与交互细节把控能力,我们使用的提示词为:创建一个HTML页面,科普JPG、PNG与SVG的格式区别,采用黑色科技风视觉风格,要求顶级审美与前沿设计水准。

测试提示词:

创建一个HTML,科普JPG/PNG与SVG的区别,黑色科技风背景,顶级审美,前沿设计。

测试结果显示,GLM-5.3和Kimi K3的表现明显更出色,页面布局、配色方案和交互细节都比DeepSeek-v4-pro更成熟耐看,尤其是两者设计的位图与矢量图对比动画,细节精致,能直观体现代码功底。DeepSeek-v4-pro虽然审美底子尚可,但整体设计风格停留在上一代水准,表现稍逊。本轮得分:GLM-5.3 ≈ Kimi K3 > DeepSeek-v4-pro-0813。

3D场景搭建测试

本次测试要求使用Three.js搭建“十万天兵天将围攻花果山”的3D互动场景网页,剧情、视角和场景都要贴合《西游记》原著设定,提示词如下:

测试提示词:

用Three.js做一个“十万天兵围攻花果山”的3D互动场景网页,剧情、视角和场景都要跟《西游记》完美对上。

测试结果:DeepSeek-v4-pro交付的成品为半成品,多次调试后页面仍无法正常渲染,全程黑屏。Kimi K3和GLM-5.3均一次生成即可正常运行,且成品质量较高。其中Kimi K3设计了四幕剧情流程和多视角预览,叙事框架完整,建模细节到位,但存在一个小瑕疵:将花果山设置在海上,不符合原著设定。GLM-5.3则采用了水墨天穹的国风长卷构图,更贴合西游故事的东方美学表达,场景还原度更高。本轮得分:GLM-5.3 > Kimi K3 > DeepSeek-v4-pro-0813。

产品官网设计测试

本次测试要求为一款开源工具设计产品宣传官网,提示词强调极致精美与顶级前沿的视觉审美,具体内容如下:

测试提示词:

给开源skill设计一个产品宣传网页,极致的精美,顶级、前沿审美。

三款模型的输出差异明显,DeepSeek-v4-pro的设计风格仍停留在早期阶段,细节和视觉质感都落后于另外两款。Kimi K3的成品效果最令人满意,采用暖色纸底搭配衬线大字和朱砂红点缀,辅以报纸分栏线、标本编号、印章贴纸等复古排版元素,整体观感舒适高级,细节动画处理也十分到位。GLM-5.3采用墨色打底搭配朱砂配色和衬线字体,走编辑部数据感的视觉路线,气质贴合产品定位,但存在二维码图片被压缩的小问题——这是因为GLM-5.3属于纯文本训练模型,本身不具备视觉识别能力,无法直接处理图片资源。本轮得分:Kimi K3 > GLM-5.3 > DeepSeek-v4-pro-0813。

网页游戏开发测试

本次测试基于一份提前编写的游戏剧本,要求开发3D互动网页游戏,测试提示词如下:

测试提示词:

根据“源记-游戏.md”剧本,开发一个3D互动的网页游戏。

测试结果:只有Kimi K3生成的版本可以完整通关,所有剧情分支都能正常触发且无脚本错误,还实现了双线叙事结构:选择不告发则进入结局《不复得路》,选择告发并带队则解锁结局《黑色桃花》,最终通过终章达成真结局《问津者》。GLM-5.3在第二关出现操作失效的问题,无法继续推进流程;DeepSeek-v4-pro则在第一关就出现代码报错,还出现了直接跳转至第二关的异常逻辑。本轮得分:Kimi K3 > GLM-5.3 > DeepSeek-v4-pro-0813。

评测总结

综合四项测试的整体表现来看,Kimi K3的综合实力最为突出,GLM-5.3紧随其后,DeepSeek-v4-pro的表现则相对逊色。速度方面,三款模型存在明显差异:DeepSeek-v4-pro生成速度最快,最复杂的游戏开发任务仅耗时十余分钟;GLM-5.3耗时约43分钟;Kimi K3耗时最长,达到67分钟。但生成速度并不等同于实际产出质量,本次测试结果显示,DeepSeek-v4-pro虽然速度更快,但落地表现未能达到国内第一梯队水准,仍有较大提升空间。

如果你有希望看到的测试场景或对比选题,欢迎在评论区留言交流。如果本次内容对你有帮助,欢迎点赞分享支持,我们下期再见。

以上内容不代表本平台立场,仅供读者参考