发布日期:2026-07-23 06:47 点击次数:130

雷科技数码组 | 编著:三明治 | 监制:罗超
什么?大模子终于也初始打减肥针了?
这可不是我胡说,据CNBC报谈,苹果正在料到初创公司PrismML,后者以其最近推出的模子压缩时间而著称,苹果但愿借此评估在iPhone上径直运行更大鸿沟AI模子的可行性。

(图源:CNBC)
要知谈这些年,每笔直机发布会的AI花式,我一般都会下意志提起水杯。
倒也不是我和厂商有啥矛盾,真实是这套历程人人都太熟了。先让AI纪念屏幕上的各式东西,再用各式图像编著去作念点个性化调色,或者是消掉相片里的路东谈主,然后本年还多数加了个技俩,叫出一个语音助手帮你点杯咖啡。
但这倒弗周至怪手机厂商,当今的主流大模子确乎塞不进手机里,编著后的端侧模子,智力又真实不太够。到头来,人人能宣传的也唯有云表更新的东西,你看豆包更了个AI播客功能,主流厂商基本上三个月内全部跟进了。
问题来了,要是齐全大模子瘦笔直机装得下,端侧AI助手就真的能转正吗?
54GB降到4GB,
模子压缩时间要普及?
率先,随着雷科技(ID:leitech)一皆来望望这两个问题:
PrismML是谁?
凭证官网先容,PrismML是一家专攻模子压缩的初创公司,它脱胎于加州理工学院研究团队,背后有Khosla Ventures、Cerberus和Google维持,研究重心等于怎么在尽量不把模子压傻的前提下,把体积和运行资本狠狠干下来。

(图源:PrismML)
他们作念了什么?
PrismML的想路和BitNet这类低比特模子阶梯有一样之处,它通过大幅简化东谈主工智能模子里面信息的存储方式来减轻模子体积,将模子中的每个权重截至为二值或三值抒发,显赫镌汰存储和运行模子所需的内存。
具体来说,传统大模子的一个参数,时常需要16bit以致32bit来保存。

(图源:HuggingFace)
在这种情况下,要是一个270亿参数模子选定FP16精度,270亿×2 Byte≈54GB,这等于Qwen3.6-27B在FP16下的大致体积。
别说智妙手机了,许多破钞级PC也很难齐全跑起来。
而在PrismML的想路下,1-bit版的参数都会被简化为 {-1, +1} ,就像往日相片上的每个像素会保存16级灰度,当今只需要保存黑、白两种灰度,固然信息亏蚀巨大,然而体积能压缩到原版的1/14,并能通过考试方式复原推感性能。

(图源:PrismML)
在这个时间的基础上,他们在7月15日肃穆推出了Bonsai-27B模子,基于Qwen3.6-27B模子微调,在保留齐全险阻文的基础上,将该模子从约54GB缩减至不及4GB,使其可以在12GB内存的iPhone上原生运行。
要知谈,谷歌面向手机和边际缔造推出的Gemma 4 E4B约3.65GB,PrismML等于用差未几的“占大地积”,塞进了花样上270亿参数的密集模子。
使用体验先不有计划,硬件厂商看完细目两眼放光。

(图源:PrismML)
是以苹果会对这玩意儿感兴味,小数都不奇怪。
要知谈,苹果我方的端侧模子简约是30亿参数,也用了2位量化、缓存分享这些技能,却只可负责手机上的及时翻译、相册搜索和邮件摘录这些功能,基本莫得Agent相关的推行技艺。
而Bonsai-27B模子,仍保留了Qwen3.6-27B的一部分Agent技艺。
天然,性能亏蚀如故有的。在PrismML我方的测试里,三值版轮廓收成简约保留全精度模子的95%,1-bit版约90%,至于器用调用这些Agent很垂青的技俩,亏蚀会更赫然。
社区测试也有东谈主反馈:PrismML三值版块比拟Q4_K_XL仍存在幻觉、Agent轮回等问题,不外上风是体积极小,基本作念到了以5.9GB逊色17.9GB的遵循。

(图源:Reddit)
但非论怎么说,能用等于比弗成用要强。
从物理赞佩赞佩上的塞不下,到实质体验能弗成承袭,链接这么激动下去,我以为后头就有得卷了。
AI手机爆发在即,
端侧AI技艺亟待普及
道理的是,7月15日,苹果智能、华为小艺、OPPO、小米、vivo等七款提供手机端侧生成式东谈主工智能的模子就业,均已在网信部门完成备案。
你别说,这名单看着挺扯后腿,赫然本年手机厂商都初始肃穆安排端侧AI了。

(图源:网信办)
原因也不难联贯,像是奉告摘录、通话整理、相册搜索、图片识别这些事情,根底没必要每次都跑去云表列队。
极端是聊天记载、相片和文献这种私东谈主信息,能在我方手机里处分天然最佳,议论到Grok最近爆发的阴私门,我竣工能联贯人人不但愿我方的信息在互联网上传来传去的心理。

(图源:雷科技)
问题是,从我个东谈主的体验来看,刻下各家手机AI功能如故以云表为主,绝大部分功能断网以后就无法使用了。
为什么会出现这种情况?刻下手机的端侧AI又发展到了什么水平呢?
碰劲,我最近也在Google AI Edge Gallery里试了Gemma 4 E4B,可以给人人分享一下使用体验。

(图源:谷歌)
率先,人人要扎眼,Gemma 4 E4B仍是算手机端侧模子里特殊能打的一款,翰墨、图片、音频都能处理;模子下载好以后,断网照样能聊。
比如Ask Image,就竣事了以往许多手机端侧AI很难作念好的多模态输入。
实测下来,Gemma 4有着可以的图片识别技艺。固然它对动漫扮装依然不太熟,然而关于画面里的特征捕捉作念得很可以,比较常见的食品、硬件、花草也都能识别出来。

(图源:雷科技)
还有Ask Audio,最多可上传30s音频并进行转写、纪念等。
这个功能就比较失色了,可能是因为我的灌音比较淘气的缘由,语音转翰墨出来的内容和原音频简直没相关系,刻下可用性挺一般的,如故老真赤诚用豆包或者千问来纪念比较好。

(图源:雷科技)
至于文本处理嘛...
我给几个能在手机端部署的模子喂了一篇2500字傍边的著作,但愿它们给出对应的著作纪念。
最终,唯有Gemma 3n E4B和Gemma 4 E4B能完成任务,然而前者耗时快要两分钟,何况给出的谜底持不住重心,后者给出的谜底愈加言近旨远,主要信息点基本都持到了,拿来快速扫贵寓竣工够用。

以致就连一些过往处分不了的逻辑题,Gemma 4 E4B也能通过永劫刻想考拿下,仅仅想考时刻远超在线大模子的反映时刻斥逐。
在雷科技看来,Gemma 4 E4B仍是诠释注解,手机腹地模子确乎颖悟活。
但唯有在拿它作念摘录、改写、粗浅识图,我风物用;可任务略微复杂小数,尤其波及长汉文、细节判断和内容创作时,它和在线大模子之间的差距依然很赫然,就更别说Agent调用一类的任务了。
要知谈,从压缩率和功能性上看,Gemma 4仍是是刻下最强的手机端侧AI了。
想要冲破这个遵循,苹果只可舍弃现存的压缩方式,通过在疏通的空间内塞入更大参数目的模子,约略才能让手机领有一个不那么容易犯傻的大脑。
参数鸿沟不遑急,
遵循才是模子运用的关键
往日人人谈大模子,总以为参数越多越有排面。
百亿仅仅起步,万亿也不嫌多,在发布会上报数字像菜商场称重,主打一个“我家萝卜,又大又壮”。
看起来没问题,然而实质运行起来等于另一趟事了。
凭证Jordan Hoffmann团队的Chinchilla scaling law研究,在疏通考试算力下,考试数据更充分的70B模子能够全面卓越欠考试的280B、530B模子,哪怕是万亿参数的MoE模子,显存占用和内存带宽依然是不小的问题。

(图源:arxiv)
更遑急的是,参数如斯普遍的模子,天然不可能干预破钞级终局。
端侧模子想要常驻手机,就得普及遵循,直面内存、功耗和散热问题。PrismML的压缩算法,算是给各家硬件厂商指明了一条路,再加上千问、百度与苹果的腹地化合营,也算是让苹果三年前本心的“苹果智能”距离信得过落地又进了一步。
以后大模子的越过,偶然还要靠参数数字吓东谈主。
能在不大的存储空间里牢固使命,少犯傻,少发烧,关键时候真能帮上忙体育游戏app平台,这才是端侧AI下一阶段最该卷的东西。
Powered by 开云平台网站皇马赞助商| 开云平台官方ac米兰赞助商 最新官网入口 @2013-2022 RSS地图 HTML地图