博智信息资讯,更全更新信息实报!
首页 > 社会热点 > 正文

揭秘苹果iPhone里的Transformer:基于GPT-2架构打造

来源:思娟 发布时间:2023-09-18 21:25
浏览:0

苹果Transformer的“秘密”,让发烧友给扒出来了。

大模型浪潮下,即使保守如苹果,也每逢发布会必提“Transformer”。

比如,在今年的WWDC上,苹果就已宣布,船新版本的iOS和macOS将内置Transformer语言模型,以提供带文本预测功能的输入法。

苹果官方没有透露更多信息,但技术爱好者们可坐不住了。

一位名叫Jack Cook的小哥,就把macOS Sonoma beta翻了个底朝天,结果,还真挖出不少新鲜信息:

-模型架构上,Cook小哥认为苹果的语言模型更像是基于GPT-2打造的。

-在分词器(tokenizer)方面,表情符号在其中十分突出。

更多细节,一起来看。

基于GPT-2架构

先来回顾一下苹果基于Transformer的语言模型能在iPhone、MacBook等设备上实现怎样的功能。

主要体现在输入法方面。语言模型加持下的苹果自带输入法,可以实现单词预测和纠错的功能。

Jack Cook小哥具体测试了一下,发现这个功能主要实现的是针对单个单词的预测。

△图源:Jack Cook博客文章

模型有时也会预测即将出现的多个单词,但这仅限于句子语义十分明显的情况,比较类似于Gmail里的自动完成功能。


△图源:Jack Cook博客文章

那么这个模型具体被装在了哪里?一通深入挖掘之后,Cook小哥确定:

我在 /System/Library/LinguisticData/RequiredAssets_en.bundle/AssetData/en.lm/unilm.bundle 中找到了预测文本模型。

原因是:

1、unilm.bundle中的许多文件在macOS Ventura(13.5)里并不存在,仅出现在了新版本macOS Sonoma beta(14.0)里。

2、unilm.bundle中存在一个sp.dat文件,这在Ventura和Sonoma beta里都能找到,但Sonoma beta的版本中更新了明显像是分词器的一组token。

3、sp.dat中token的数量跟unilm.bundle中的两个文件——unilm_joint_cpu.espresso.shape和unilm_joint_ane.espresso.shape能匹配得上。这两个文件描述了Espresso/CoreML模型中各层的形状。

进而,小哥根据unilm_joint_cpu中描述的网络结构,推测苹果模型是基于GPT-2架构打造的:

主要包含token embeddings、位置编码、解码器块和输出层,每个解码器块中都有类似gpt2_transformer_layer_3d这样的字眼。


△图源:Jack Cook博客文章

根据每层大小,小哥还推测,苹果模型约有3400万参数,隐藏层大小是512。也就是说,它比GPT-2最小的版本还要小。

小哥认为,这主要是因为苹果想要一种不太耗电,但同时能够快速、频繁运行的模型。

而苹果官方在WWDC上的说法是,“每点击一个键,iPhone就会运行模型一次”。

不过,这也就意味着,这个文本预测模型并不能很好地完整续写句子或段落。


△图源:Jack Cook博客文章

模型架构之外,Cook小哥还挖出了分词器(tokenizer)的相关信息。

他在unilm.bundle/sp.dat里发现了一组数量为15000的token,值得关注的是,其中包含100个emoji。

Cook揭秘库克

尽管此Cook非彼库克,小哥的博客文章一发出,还是吸引了不少关注。

基于他的发现,网友们热烈地讨论起苹果在用户体验和前沿技术应用之间的平衡大法。

回到Jack Cook本人,他本科和硕士毕业于MIT的计算机专业,目前还在攻读牛津大学的互联网社会科学硕士学位。

此前,他曾在英伟达实习,专注于BERT等语言模型的研究。他还是《纽约时报》的自然语言处理高级研发工程师。

那么,他的这一番揭秘是否也引发了你的一些思考?欢迎在评论区分享观点~

原文链接:https://jackcook.com/2023/09/08/predictive-text.html

责任编辑:随心

热门文章

  • suv销量排行榜前十口碑最好,值得购买
    suv销量排行榜前十口碑最好,值得购买

    suv销量排行榜前十口碑最好,值得购买

    随着国内经济的发展和消费者购买能力的提高,车市整体呈现逐月环比持续上涨的良好态势,不同车型的销售表现也是异彩纷呈。SUV作为市场上最受欢迎的车型之一,其销售情况自然备受关注。Model Y月销破五万上...

  • 家庭养什么狗最干净(家庭养什么狗最好排行榜)
    家庭养什么狗最干净(家庭养什么狗最好排行榜)

    家庭养什么狗最干净(家庭养什么狗最好排行榜)

    很多朋友对于最好的宠物狗排名和最好的宠物狗排名第一不太懂,今天就由小编来为大家分享,希望可以帮助到大家,下面一起来看看家庭养什么狗最干净!宠物狗好养排名1、NO.1:泰迪 泰迪(又称贵宾犬)...

  • 小伙误把奶茶赠品雪花膏当雪糕吃,问了商家才知是护肤品
    小伙误把奶茶赠品雪花膏当雪糕吃,问了商家才知是护肤品

    小伙误把奶茶赠品雪花膏当雪糕吃,问了商家才知是护肤品

    据报道,9月16日,河南郑州。00后小伙发视频称自己把奶茶赠品雪花膏当冰淇淋吃了一口。当事人翟先生介绍,自己点了3杯奶茶,收到后发现袋子里有一个圆圆的东西,摸着还是冰凉的,揭开银色的皮里面是乳白色的,...

  • 国内油价或破9元,网友看了忙表示:准备去加油
    国内油价或破9元,网友看了忙表示:准备去加油

    国内油价或破9元,网友看了忙表示:准备去加油

    本周三晚上12点(20日24时)国内成品零售价第19轮调整,油价将面临大幅上涨,将创下今年新高!当前预测涨幅高达7.52%,折算后每升上涨超过3毛,部份地区95号汽油可能进入“9元时代”,朋友们提前加...

  • 武汉一居民电梯往返1次收1元,包月10元,具体怎么回事?
    武汉一居民电梯往返1次收1元,包月10元,具体怎么回事?

    武汉一居民电梯往返1次收1元,包月10元,具体怎么回事?

    最近,“武汉一居民电梯往返1次收1元”引发网友讨论,看看具体怎么回事?9月17日,湖北武汉,有网友发视频称已居民楼内的电梯需扫码付款才能乘坐。据拍摄者李女士称:当时自己跟随租房中介到此处看房,发现楼内...

生活常识

更多 >
  • 家里安装电地暖好还是水地暖好?该如何选择
    家里安装电地暖好还是水地暖好?该如何选择

    现在天气越来越冷了,对于要装修的小伙伴来说,也是时候考虑安装供暖设备了。虽然现在供暖设备五花八门,但最常让业主朋友纠结的还是:家里安装电地暖好还是水地暖好?你的家适合安装哪一种?说说两者的发热原理。电...

  • 动物奶油和植物奶油哪个好?怎样辨别?孩子适合吃哪种?
    动物奶油和植物奶油哪个好?怎样辨别?孩子适合吃哪种?

    动物奶油和植物奶油最主要的区别在于以下四个方面:1.成分不同:动物奶油,源于全脂牛奶,经过离心,牛奶中的脂肪被分离出来制作成动物奶油。脂肪含量较低的淡奶油,一般用在咖啡、奶茶中;脂肪含量较高的奶油经打...

生活常识轮子不转、刹车不灵!超多的轮滑鞋不合格
生活常识宝宝第一口辅食吃米粉,还是鸡蛋黄?
生活常识微信银行卡如何解除绑定
生活常识如何挑选适合的洗衣机,需要注意这些方面

创业路子

更多 >