文章正文

绿灯侠

66款AI硬件通过L3认证:华米OV耀全员入围,但没人突破L4天花板_我的网站

女生名叫黄蒲军校

A |     持续了两年的AI硬件狂欢,终于进入了下半场。    如果你从去年就开始用 Gemini,那感觉就像看着自家兄弟慢慢得了阿尔茨海默症。         2026年7月17日,工信部牵头的《人工智能终端智能化分级》系列国家标准首次公布测试结果,覆盖移动终端、微型计算机、电视、眼镜、汽车座舱、音箱六大品类,17家企业的66款产品通过L3辅助级认证。         这是最近网友对 Gemini 的一句调侃。         手机品类的名单没有悬念,华为、小米、OPPO、vivo、荣耀、摩托罗拉、联想、智跃星辰,八大厂商共11款机型全部达到L3,主流手机品牌在AI能力上实现了全员入围,无人缺席。

B |          按理说,一家公司发新模型,通常是来打脸这种调侃的。可就在刚刚,Google 一口气发了三个新模型之后,网友非但没收回这句话,反而笑得更大声了。多少有种他们都不看好你,可偏偏你最不争气的即视感。

C |          三个模型分别是 3.6 Flash、3.5 Flash-Lite,还有一个专搞网络安全的 3.5 Flash Cyber。         图源:《人工智能终端智能化分级》          除手机外,66款L3产品中,微型计算机独揽41款,电视9款,汽车座舱3款,眼镜和音箱各1款。官方博客的措辞也相当眼熟,「更高效」「更聪明」「为大规模 AI agent 而生」,一句不落。

D | 部分眼镜、耳机仍停留在L2工具级。         只不过,实际体感却冰火两重天。从数量来看,AI终端智能化进程出现了明显的品类阶梯:PC领跑,手机紧随其后,穿戴设备仍在追赶。         雷科技(ID:leitech)认为,随着分级标准的落地,AI硬件狂欢正式进入下半场。         主角登场,3.6 Flash 到底强在哪          先说头牌,3.6 Flash。         华米OV耀喜提L3,代表当前最高水平          先简单跟大家说说L1-L4的区别,以及为什么L5没有在分级名单中。         L1 被称为响应级,终端仅具备被动响应能力,执行预设指令,如语音唤醒等,没有AI加持的Siri大概就是这个级别。L2 被称为工具级,终端可调用工具完成特定任务,初步具备场景感知能力,不过,在这个阶段用户指令仍需精确表述,模糊意图会导致执行失败,目前部分AI穿戴设备处于这一水平。官方给的定位就俩字——「主力」(workhorse),干活模型。

E |          3.5 Flash 是今年 5 月 I/O 大会上发的,这次算是小版本迭代。         L3 是当前标准体系中有明确定义的最高等级,也叫辅助级。         最大的卖点是省 token。         按 Artificial Analysis Index 的数据,3.6 Flash 比 3.5 Flash 少用 17% 的输出 token,在 DeepSWE(Datacurve 出的基准)这类场景上甚至能省到 65%。

F | 能实现复杂意图理解与主动澄清、任务自动分解与工作流编排、多工具动态调用与分布式任务协同、跨模态内容生成,以及短期和长期记忆能力。官方还说它跑多步任务时,推理步数和工具调用都更少。         图片来源:豆包          L4 是协同级,指向跨设备自主协同与主动场景感知,不过,现在对于L4的标准尚未完全明确,未来将随产业发展逐步完善。也就是说,干同样的活,废话更少,绕路更少,账单更薄。

G |          值得注意的是,早期电信终端产业协会的《终端智能化分级研究报告》曾提出L5级别,即AI在感知和规划完成后,直接代为执行支付与下单操作,无需用户确认,但这一等级最终未被纳入国标。         价格也确实降了。输入 1.5 美元/百万 token,输出 7.5 美元/百万 token——注意,上一代 3.5 Flash 的输出是 9 美元,这波直接砍到 7.5。又快又省,单个 agent 任务的成本就压下来了。         基准测试上,官方摆出了一整排数据。         原因在于主动服务的边界难以界定:比如当你对一款显卡犹豫不决时,AI直接帮你下单,那用户的数据安全与财务风险可能会失控。         代码能力是重点。DeepSWE 从 37% 提升到 49%,官方的说法是多余的代码改动更少、执行循环也更短,生成的代码更贴近生产环境的要求。因此最终决策权应当保留在人类手中,原定的L5标准也可以看成是AI硬件的进化边界,可以辅助,但不能替代。         总而言之,目前L3代表的就是当前量产AI终端的真实技术水位,L4尚处于工程验证与标准讨论阶段。

H | 机器学习研究方向的 MLE Bench 提升更明显,从 49.7% 拉到了 63.9%。         计算机操作(computer use)能力也有长进,OSWorld-Verified 从 78.4% 升到 83%。

I | 并且,「计算机操作」(computer use)也成了Gemini API 和企业版的内置工具,主打一个开箱即用。

J |          知识工作方面,GDPval-AA v2 从 1349 涨到 1421。

K |          从各家技术路线来看,华为搭载的小艺伴随式AI,强调端侧优先处理与隐私保护,能够在用户授权下主动提供服务而非被动等待唤醒;小米基于自研MiMo端侧大模型构建Xiaomi miclaw智能体,宣称可调用超过50项系统工具,支持跨应用、跨设备的多步骤任务编排;荣耀的YOYO智能体、vivo的蓝心大模型、OPPO的安第斯大模型,各自在端侧推理和多模态交互上投入了可观的研发资源。

L |          图片来源:Android Central          但上述所有技术储备,目前的上限就是L3。这并非某一家厂商的问题,而是整个产业面临的技术性难题,端侧算力密度、模型推理效率、多Agent协同框架的成熟度,共同构成了L3到L4之间的技术壁垒。

M |          巧的是,L4所指向的跨设备自主协同,恰好是各厂商发布会上反复描绘的未来图景,比如小米的人车家全生态、华为的1+8+N,框架早已搭建完成,但产品层面的实现尚需时日。Hebbia、Harvey 等客户反馈,它在文档解析、图表数据分析、报告起草这类多模态任务上表现尤其突出。         L3到L4两者之间的距离,就是AI终端产业未来三到五年的核心竞争区间。         PC拿下41款L3认证,白牌可能面临淘汰          让我们再回到《人工智能终端智能化分级》中,除手机外,其他品类也值得说道。Figma、JetBrains 也都出面背书了一番。         哦对了,还有个不起眼但挺实在的更新:知识截止日期终于从 2025 年 1 月推进到了 2026 年 3 月。老黄历总算翻篇了。         PC品类总共41款,相比其他有着压倒性的优势,主要原因是联想等厂商拥有完整的商用产品线和庞大的SKU矩阵,比如仅联想一家就贡献了37款AI PC,此外PC天然具备大算力芯片、充足散热空间和成熟的操作系统生态,是端侧大模型部署的最优载体之一。         安全这块,官方说 3.6 Flash 上了升级版的 Frontier Safety 防护,重点盯着 CBRN(化学、生物、放射性、核)和网络攻击这两类滥用,抗越狱能力更强了,同时又尽量不误伤正常需求、少乱拒绝。         科大讯飞副总裁娄超在WAIC现场也下了类似的判断:“PC一头连接国产算力、操作系统、大模型等技术创新,一头连接政务、教育、医疗和企业办公等实际需求,是推动AI终端产业发展的重要载体。”          图源:雷科技摄制          手机的挑战在于功耗比和散热,在手掌大小的空间内运行端侧大模型,对芯片能效比提出了极高要求。         同样受限于空间体积的还有穿戴设备品类,一副AI眼镜的目标重量通常控制在40至80克,在这一约束下能容纳的芯片算力、电池续航和散热能力都极其有限。         ·以小博大,便宜大碗的 3.5 Flash-Lite 也能更换推理档位了          第二个是 3.5 Flash-Lite,定位比 3.6 Flash 还低一档,主打「快」和「便宜」,专治高吞吐、低延迟的任务,比如 agent 搜索、文档处理。目前行业主流的解决方案是端侧采集+云端/手机端处理的架构:眼镜负责语音收音、图像采集和交互入口,核心AI任务卸载至手机或云端完成。         它是 3.5 系列里最快的,按 Artificial Analysis 的测量是每秒吐 350 个 token。         但这不意味着AI眼镜的智能化进程滞后于市场需求。价格更是白菜——输入 0.3 美元、输出 2.5 美元每百万 token。官方说质量比 3 月发的 3.1 Flash-Lite 好一大截。         有个设计挺灵活:它支持调「推理档位」。

N | 恰恰相反,AI眼镜是2026年增长最快的消费电子品类之一,IDC数据显示,2026年一季度全球出货量达356.6万台,同比增长130.1%。

o | 低配活儿就开最低档,图个快和省;碰上要多步拆解的子任务,就把思考档位往上拨。         用户对AI眼镜的接受度也比其他AI硬件高,据新华网报道,2026年春节期间,深圳华强北AI眼镜销量较平日激增70%至80%,经销商数量从零增至上百家,小雷此前去华强北也印证了这一点。         图片来源:千问          随着端侧AI芯片在能效比上的持续突破,以及MicroLED+光波导显示技术的成熟,眼镜品类从L2跨越到L3只是时间上的问题,节奏虽然有先后,但方向无差别。         可能AI分级对产业格局真正的冲击,是以华强北为代表的白牌AI硬件生态。

p |          从家电圈能效等级的二十年历史来看,当分级标签成为消费者购买决策的核心依据,渠道体系会自发完成出清,电商平台和线下卖场没有动力让L2产品与L3产品同台竞争,白牌们可能要思考下一步该去向何方了。电脑操作这次也做成了内置工具。         跟前代比,提升相当明显:代码和 agent 任务的 Terminal-Bench 2.1,从 31% 干到 54%;长上下文的 GDM-MRCR v2,从 60.1% 提到 72.2%;真实任务执行的 GDPval-AA v2,更是从 642 飙到 1140。         最有意思的是,这个「小弟」在不少 agent 和代码任务上,居然反超了辈分更高的 3 Flash。         标准画了一条线,但AI的想象力可以越界          当然,硬币也有另一面,L1到L4的分级框架下,相当于行业已经定义好了什么叫“智能”,你想达到L3,那就必须符合理解意图、拆解任务、多模态交互、持续记忆这些特征,不符合的就是L2甚至L1。         比如 SWE-Bench Pro(54.2% vs 49.6%)、OSWorld-Verified(74.0% vs 65.1%)。         这套逻辑拿来衡量手机和PC,没问题,但AI硬件的想象力肯定远不止手机和PC。

q | 以小博大,属实有点东西——等于说跑 3 Flash 的活儿,现在有了个更快更强的平替。         官方还举了几个用法:从海量电商数据里抽产品特征、给 3.6 Flash 当副手一口气生成 25 个网页设计方案、批量翻译总结收据、边玩边迭代做小游戏。Ashler、Palo Alto Networks、Ramp 这几家客户也来夸了它「速度、智能、成本三合一」。         回想一下过去两年那些不太像传统终端的AI产品,比如昙花一现的AI Pin,试图用激光投影取代屏幕,靠语音和手势完成所有交互;Rabbit R1用一个大模型操作APP的思路重新定义了什么叫用手机,虽然体验翻车,但这股探索的劲值得鼓励。         最后一个 3.5 Flash Cyber,画风突变,专门用来找和修代码里的安全漏洞。         Google 的逻辑挺有意思:现在 AI 找漏洞的速度,已经比现有系统修漏洞的速度快了。         如果按现有的L1-L4标准来打分,这些产品大概率连L2都勉强,它们根本没有调用系统工具的框架,也不追求跨模态生成,它们探索的恰好是标准框架之外的可能性。既然漏洞越堆越多,那干脆用便宜高效的 Flash 来批量补锅。         这个模型是在 3.5 Flash 基础上微调出来的,搭配自家的 CodeMender 工具用。CodeMender 里跑的是好几个 Flash Cyber agent,协同工作、最后汇总成一份报告。         (图源:AI PIN/Humane)          不是小雷抬杠哈,标准天然是后验的,它总结的肯定是已经做出来的,但未来应该做什么,可能出现什么,都是未知数。         在业内有名的 CyberGym 基准上,官方称它摸到了第一梯队的水平,还比更大的模型更省 token。         举个例子,2007年如果有人给智能手机下个标准,大概率会把全键盘、触控笔、物理导航键写进去,然后说没有这些不算智能。         但iPhone用一块玻璃屏幕把所有这些定义全推翻了,AI终端现在正处在类似的节点上,技术路线远未收敛,产品形态还在试错。

r |          不过这模型我们暂时也用不上。         考虑到「找漏洞」这种能力是把双刃剑,浓眉大眼的 Google 也学 Anthropic 玩起了安全叙事。这时候用一套固定框架把所有产品装进四个格子里,装不进去的东西是不合格还是不在框架内?这两个说法之间的差距,就是品牌们可能会踩到的坑。把它锁得死死的——只对「可信合作伙伴」限量开放,走内测。

s | 目的是给一线防守方争取时间,赶在漏洞被人利用前先修掉,同时防着有人拿它去干坏事。         反过来说,没有标准也不行,过去两年“AI”标签被用滥了,从九块九的玩具到旗舰手机,什么东西都敢叫AI,分级至少让市场有了一个公认的标准,不至于人人AI。         说好的 3.5 Pro 呢?如来          看到这儿你可能会问:发了一堆 Flash,那真正的旗舰 3.5 Pro 去哪了?          官方口径是「正在和合作伙伴测试,准备好就上」。         如果未来L4、L5的标准修订能跟得上技术演进速度,新品类能及时被纳入分级框架,那它就是助推器。反过来,如果标准五年修订一次、品类列表十年不变,那它迟早变成一堵墙。但这套说辞背后的故事,可能没那么体面。

t |          说到底,《人工智能终端智能化分级》开了一个好头,但能不能保持开放性,让下一批AI Pin和Rabbit R1在诞生时,不至于直接被贴上不合格的标签,这才是衡量这套标准格局的终极考题。

u |          总而言之,这是中国AI硬件交出的第一份标准化答卷,但从目前来看,这份答卷的意义不在于分数本身,而在于它把“智能”从一个形容词变成了量化指标,从此以后,发布会上敢说自己AI领先的厂商,得先过标准这一关。         据彭博社等媒体报道,3.5 Pro 的代码生成能力一直没达到内部预期。         但大家也不必把标准当终点,PC和手机领跑L3,穿戴设备在追赶,品类之间的节奏差需要时间熨平,而标准框架本身的开放性,能不能接纳手机和PC之外的新物种,能不能在技术突变时快速迭代,决定了它是天花板还是起跑线。

v | Google 6 月下旬还专门更新了一版训练数据来补代码这块短板,结果成绩依旧没起色。更有传闻说,Google 干脆推翻了原来的训练方案,从零开始重训。         而 Google AI 宣传委员 Logan Kilpatrick 更是索性在舆论上直接跳过 3.5 Pro,将预告的重点放在了Gemini 4,声称他们已经启动了史上最雄心勃勃的 Gemini 4 预训练,还放话说进展让人兴奋。         听着虽然挺提振人心,但把它放在「旗舰跳票」的背景下看,多少有点转移视线、画饼续命的味道了。         除了这些内幕,光看今天刚刚发布的 Flash 模型本身,网友们也并不全然买账。

w |          第三方评测机构 Artificial Analysis 表示:两个新模型确实把单任务耗时砍半、token 效率也提升了,Flash-Lite 的智能指数涨了 11 分——但 3.6 Flash 的智能水平,相比 3.5 Flash 基本原地踏步。         价格没有便宜到足以忽略能力差距,能力也没有高到能够解释它的成本。         X 网友吐槽道:3.6 Flash 在 Artificial Analysis 上跟 3.5 Flash 拿了一模一样的分,还不如 Meta Spark 1.1、GLM-5.2、5.6 Luna、Sonnet 5、Grok 4.5、5.6 Terra 这一票对手,直呼简直烂透了(阴阳怪气 doge)。

x |          吐槽的还不止一个。

y |          网友 Angel 则直接从性价比入手:Gemini 3.6 Flash 的使用成本比 GPT-5.6 Sol medium 还高,可智能程度反而更低。又贵又笨,这组合属实有点尴尬——毕竟 Flash 系列立身的根本就是「性价比」,结果被人当场指出性价比不如对手,等于自砸招牌。         作为对比,OpenAI 的 Tibo 刚刚也发话了:由于周活跃用户达到 1000 万,新的一天,Codex 和 ChatGPT Work 的付费用户迎来新一轮额度重置,尽情享用。         这对比,这落差,还有人记得大明湖畔的 Google Gemini 3?          实测派也来补刀。网友 Balder 更是直接开团:          这三个模型性能全比之前的 3.5 Flash 差。他甩出自己的测试吐槽,说问题包括但不限于——基础解码就有毛病、中文选词经常很离谱;生成的图片视频质量极差、跟指令对不上还限额严重;经常记忆混乱、调用完全错误的工具。         而且他还上了个阴谋论,认为 Google 之所以这么搞,是为了把算力腾出来卖给 Anthropic,还阴阳了一句这就是皮查伊想要的「Cloud First」。         此外,X 网友 Conor Dart 用 Google 自家的 Antigravity 跑了个 AI 生成游戏的测试,结果没有出乎意料,木头纹理更差了,大理石看着差不多但还是不能用。他直言这又是一次翻车,表示自己还是等 Gemini 3.5/3.6 Pro 吧。         简言之,你别问新模型强不强,你就说 Flash 不 Flash 就完事了。一边是官方更高效、更便宜、更省 token的漂亮账本,一边是大多数网友的当场差评,以及模型背后的旗舰跳票、大牛出走、市值缩水等一连串糟心事。         这很难不让人好奇是不是 Google 这次真点歪了科技树,光顾着省成本忘了提智商,只能先靠几个 Flash 稳住场子?          反正 Gemini 4 的预训练都开跑了。这一把要是再翻车,那句阿尔茨海默的玩笑,可就真要成谶语了。

Current article:http://lichuorenrenyitankanmeimu.cfd/list_dji1g55/slp2n.html

Published on:12:22:38


|