文章摘要
退隐十年的互联网初代创业者陈大年创办初创公司StartLux(原点星辉),推出270亿参数本地模型StartLux-V1.0-27B-Preview。该模型在信通院可信AI测试中获综合第二,仅落后榜首万亿参数模型1.3个百分点,可在消费级PC离线运行。陈大年认为大模型发展不应只堆参数,公司计划年内推出商用本地智能解决方案。

最近国产大模型赛道出现了一匹低调的黑马:一款仅270亿参数的本地模型,在权威机构的专项测试中拿下综合第二的成绩,仅比参数量高达1.6万亿的旗舰模型落后1.3个百分点,直接追平了一众千亿级云端旗舰产品。

这款黑马模型名为StartLux-V1.0-27B-Preview,来自初创公司StartLux(原点星辉),其创始人兼CEO是互联网初代创业者陈大年。这位曾被称为共享软件教父的连续创业者,在退隐十年后再次回归,将全部赌注押在了本地模型赛道上。

在不久前的盛大创新院18周年老友聚会上,陈大年公开分享了AI时代的八条非共识观点,其中四条都在强调本地模型的未来价值。他提出,本地模型将彻底重塑云端市场,三年内有望追平并占据80%的市场份额,单纯比拼模型参数量的发展路径已经过时。

StartLux正是这一理念的落地实践,这家公司没有跟随行业大流追逐超大参数模型,而是专注于小而美的本地模型商业化,也是全球范围内首家真正意义上的本地模型公司。此次亮相的首款产品,就能直接在消费级PC上离线运行,无需依赖云端服务。

权威测试中的亮眼表现

这款270亿参数的模型,之所以能引发行业关注,源于它在专业测试中的硬核表现。本次测试来自国内权威机构的可信AI大模型基准MCP专项测试,该测试围绕位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计六大真实应用场景设置任务,同时增加了综合评估环节,重点考察模型的多工具协同能力、复杂任务执行效果以及真实环境交互水平,而非单纯的文本回答准确性。

测试结果显示,StartLux-V1.0-27B-Preview综合得分达到39.25%,位列所有参评模型第二。它不仅超过了参数量284B的DeepSeek-V4-Flash-0731和198B的Step-3.7-Flash,仅比排名第一的1.6万亿参数DeepSeek-V4-Pro落后1.3个百分点。即使在同参数规模的竞品对比中,这款模型也比Qwen 3.6高出5.34个百分点。

在单项成绩方面,StartLux-V1.0-27B-Preview同样表现出色,位置导航、金融分析和浏览器自动化三个细分赛道均位列第一,其余参评项目也都处于行业第一梯队。

为了更直观地展示模型的实际能力,官方还公布了两场实战对比测试。第一场是跨两年的微软股票投资计算任务:假设在2023年1月9日投入25000美元,持有至2025年1月8日收盘,最终收益和总收益率分别是多少?

Prompt:如果在2023年1月9日往微软投入25000美元,一直持有到2025年1月8日收盘,最终价值和总收益率分别是多少?

对比模型Claude Sonnet 4.6给出的结果为47254美元、总收益率89.02%,但由于误将2025年1月8日判断为非交易日,实际使用了前一日的收盘价计算,结果存在误差。而StartLux-V1.0-27B-Preview则先回查历史数据,验证了目标日期附近的行情,确认准确收盘价后完成计算,最终得出47499.09美元、90.00%的正确结果,整个计算过程可复核、可追溯。

第二场测试则是浏览器机票查询任务:打开Google Flights,查找从新加坡飞往北京、5天后出发的最便宜直飞经济舱,且不选择大兴机场,任务完成后关闭浏览器。

Prompt:浏览器打开Google Flights,找一班从新加坡飞北京的单程航班,5天后出发,我要最便宜的直飞经济舱,而且不要落在大兴机场。只看价格,任务结束后关闭浏览器。

StartLux-V1.0-27B-Preview仅用时约95秒就完成了整个搜索流程,找到了价格为299美元的国航直飞航班,全程仅用12步操作。反观Claude Sonnet 4.6,在日期选择、弹窗关闭和筛选菜单之间反复确认,还一度误触了时间筛选面板,耗时超过200秒才完成搜索,最终给出的最低报价为556美元,操作步数多达21步。

这两场实战足以说明,在Agent任务场景中,模型参数量已经不再是唯一的决定性变量,后训练的质量才是提升实际能力的关键。

小模型的制胜密码

StartLux-V1.0-27B-Preview并非从零开始训练的全新模型,它的基座是Qwen3.6-27B,最终测试成绩却比基座模型高出不少,核心优势来自针对性的任务数据和自动化后训练方法。

团队的训练重点并非单纯提升模型的文本生成能力,而是打造更擅长完成实际任务的Agent。训练数据重点强化了模型的任务理解、工具选择、参数构造、多步执行、状态检查和结果验证等核心能力,让模型不仅能输出最终文本,更能掌握调用工具的时机、异常情况的处理逻辑以及任务完成的判断标准。

在此基础上,团队自研了一套多维度、可验证、可规模化的模型迭代优化技术,其中采用了Auto Research(AI训练AI)的方法,让模型能够在真实的工具环境中自主执行任务,并根据环境反馈持续调整自身策略。前文提到的金融分析案例中的回查修正,以及浏览器任务中的约束识别和路径优化,都是这套后训练技术的直观体现。据官方介绍,StartLux-V1.0-27B-Preview也是国内首个采用该方式完成后训练的本地Agent模型。

这并不意味着传统的Scaling Law失效,大参数云端模型仍然是当前行业的主流选择,但StartLux的实践清晰地传递了一个信号:大模型的发展路径并非只有堆参数这一种。陈大年曾将Scaling Law比作“过路神仙”,他表示没有参数规模的积累,AI无法走到今天,但这一发展路径只是行业发展过程中的一个阶段,未来的行业主导权未必属于单纯堆参数的玩家。

当前大模型技术路径已经出现了显著的分野:一边是“大力出奇迹”的忠实追随者,持续将参数量从百亿提升到千亿、再到万亿,训练成本也呈指数级攀升;另一边则是以Agentic评估体系为代表的“少即是多”路线,越来越多的行业专家开始意识到,高质量的实际行动能力才是大模型的核心价值。StartLux的实践,为小参数模型的发展提供了又一个有力的佐证。

本地模型的商业化探索

StartLux之所以坚持本地模型路线,源于其独特的成本和体验优势。当模型部署在本地PC上时,长时任务的成本结构将从持续累积的云端Token费用,转化为更可控的设备算力和电力消耗,同时模型还能更好地理解用户的长上下文信息,实现更个性化的服务目标。

目前包括Meta、Google、NVIDIA在内的科技巨头都在加码本地小模型赛道,但大多仍停留在实验阶段或面向极客群体,真正实现本地模型产品化的公司,目前仅有StartLux一家。团队表示,后续将稳步推进自有基座模型的训练,探索扩散式语言模型等新型架构,只要路线正确,本地智能的未来值得期待。

核心团队与商业化布局

选择本地模型这条非共识的赛道,需要兼具勇气和实力的团队。StartLux的核心团队正是这样的组合,形成了企业家与科学家强强联合的黄金阵容。

CEO陈大年是中国互联网初代创业者,也是国内最早引入“共享软件”概念的程序员。他与二哥陈天桥共同创办了盛大网络,同时也是互联网创新摇篮盛大创新院的创始人,国民级产品WiFi万能钥匙正是由他一手孵化。陈大年对国内市场的用户需求和产品逻辑有着深刻的理解,本地模型赛道正是他熟悉的领域。

负责技术落地的是联合创始人兼CTO郭权玮,他拥有国立阳明交通大学计算机科学与工程博士学位,研究方向覆盖本地部署大模型、Agentic AI、AI for Science、AI for Finance和隐私保护机器学习等领域。在加入StartLux之前,他曾任幻量科技首席算法科学家,更早之前在台湾工业技术研究院从事数据隐私、数据去标识化和隐私保护机器学习的研发工作,是2024年TAAI最佳论文奖获得者,同时以第一发明人身份拥有多项数据隐私相关的发明专利。

另一位联合创始人罗永祥,则拥有深厚的金融和投融资背景,曾担任摩根士丹利亚洲董事总经理,负责公司的市场拓展和投融资业务。

三人的组合完美适配StartLux的发展定位:陈大年负责产品和用户方向,郭权玮主导技术研发和落地,罗永祥负责市场和资本运作,这套团队架构将为公司的长线发展提供坚实的支撑。

StartLux的目标并非仅仅提供模型权重文件,而是打造像安装Office一样简单的本地智能解决方案。用户无需了解量化、显存配置和推理框架等专业技术细节,也不需要反复调优参数,即可一键完成部署。团队计划在年内面向企业和个人用户推出第一代本地智能解决方案。

从这个角度来看,StartLux的出现绝非国产大模型赛道又多了一名玩家那么简单。在DeepSeek、Kimi等云端模型公司崛起之后,国产本地模型赛道终于迎来了首批补位者。从互联网时代的初代程序员,到智能时代的AI创业者,中国的科技公司始终在接力推动行业的发展,模型的基本范式正在换挡,但创新的脚步从未停歇。

官网链接:https://startlux.com/

以上内容不代表本平台立场,仅供读者参考