侧边栏壁纸
博主头像
西瓜码农

成功需要脚踏实地,一步一个脚印

  • 累计撰写 393 篇文章
  • 累计创建 1 个标签
  • 累计收到 0 条评论

目 录CONTENT

文章目录

27B本地模型硬刚万亿参数DeepSeek?我扒了这份测试报告

27B本地模型硬刚万亿参数DeepSeek?我扒了这份测试报告

今天AI圈最提气的一条消息,不是OpenAI又发了多大参数,而是一家名不见经传的国产公司——StartLux(上海原点星辉),用一颗27B参数的本地模型,在信通院的MCP专项测试里干翻了284B的DeepSeek-V4-Flash,甚至在某些单项上和1.6T参数的DeepSeek-V4-Pro打平。参数只有别人的零头,成绩却排到了第二。

更关键的是:这个模型能在消费级个人电脑上跑。也就是说,不用充会员、不用排队,你本地就能拥有一颗"小钢炮"级别的Agent模型。今天这篇,我把测试报告和背后的逻辑给你扒清楚。

27B凭什么打赢284B?

先看硬数据。中国信通院人工智能研究所公布的检验报告显示,StartLux-V1.0-27B-Preview在可信AI大模型基准测试(MCP专项)中,综合得分39.25,排名第二,仅次于DeepSeek-V4-Pro,超越了284B的DeepSeek-V4-Flash-0731和198B的Step-3.7-Flash。

单项上更夸张:

  • 位置导航:斩获第一
  • 浏览器自动化、金融分析:与1.6T参数的DeepSeek-V4-Pro并列第一
  • 同等参数规模下,比Qwen-3.6-27B高出5.34个百分点

测试涵盖位置导航、网页搜索、浏览器自动化、金融分析、代码仓库管理、3D设计6类专项任务,重点考察的是多工具协同、复杂任务执行、真实环境交互——说白了,测的不是"会不会聊天",而是"能不能干活"。

它是怎么做到的?

技术路径很有意思。StartLux不是从零训,而是以Qwen3.6-27B为基座做后训练定向增强,团队自研了一套"AI训练AI"(Auto Research)的方法——让模型自己设计训练实验、自己跑、自己根据反馈优化策略。这也是国内首个用该方法做后训练的本地Agent模型。

说白了,参数军备竞赛已经到头了。当基础能力跨过实用门槛,比的不再是谁参数多,而是谁更会"干活"、谁更省成本、谁数据更安全。这正是本地小模型的机会窗口——Google、Meta、英伟达都在押注30B级别本地模型,不是没道理的。

对普通人有啥用?

这才是重点。StartLux-V1.0-27B-Preview已经能在消费级个人电脑上运行,公司计划年内推出第一代本地智能解决方案。这意味着:

  • 数据不出本机,隐私安全,不用怕聊天记录被拿去训练
  • 不用订阅、不用排队,一次部署长期白嫖
  • 断网也能用,适合办公、金融、代码等敏感场景

对开发者来说,本地跑一个能调浏览器、能做金融分析、能管代码仓库的Agent模型,意味着很多自动化流程可以脱离云服务、完全本地化,成本直接砍到接近零。

我的看法

跑分只是参考,真上手才知道好不好用。但这条消息释放的信号很明确:本地小模型正在从"玩具"变成"生产力工具"。当27B就能干翻万亿参数,那"越大越强"的迷信就该被打破了。

对普通用户,我的建议是:别急着追新模型,先把手头能本地跑的用起来。省下的订阅费、换来的隐私,都是实打实的。等StartLux年内正式方案出来,值得蹲一波实测。

来源:AIBase、中国信通院人工智能研究所

发布时间:2026-08-31

0
  1. 支付宝打赏

    qrcode alipay
  2. 微信打赏

    qrcode weixin

评论区