2025-05-14 15:01:03
作者:科技
分享:
【导语】苹果机器学习团队于5月13日在GitHub上开源了一款名为FastVLM的视觉语言模型,提供0.5B、1.5B、7B三个版本。该模型专为Apple Silicon设备端侧AI运算优化,采用自研MLX框架和LLaVA代码库训练,实现了高分辨率图像处理的近实时响应,且计算量大幅降低。FastVLM的核心是新型混合视觉编码器FastViTHD,处理速度较同类模型提升显著,体积大幅缩小。此举标志着苹果在构建完整的端侧AI技术生态方面迈出重要一步,预计将在未来的智能眼镜等穿戴设备上发挥关键作用。

5 月 13 日消息,苹果机器学习团队在 GitHub 发布并开源了一款视觉语言模型 ——FastVLM,提供 0.5B、1.5B、7B 三个版本。
据介绍,该模型基于苹果自研 MLX 框架开发并借助LLaVA 代码库进行(xíng)训(xun)练(liàn),专(zhuān)为(wèi) Apple Silicon 设(shè)备的端侧 AI 运算进行优化。
技术文档(dàng)显(xiǎn)示(shì),FastVLM 在(zài)保(bǎo)持(chí)精(jīng)度(dù)的(de)前(qián)提(tí)下(xià),实(shí)现(xiàn)了(le)高(gāo)分(fēn)辨(biàn)率(lǜ)图(tú)像(xiàng)处(chù)理(lǐ)的(de)近(jìn)实(shí)时(shí)响(xiǎng)应(yīng),同(tóng)时(shí)所(suǒ)需(xū)的(de)计(jì)算(suàn)量(liàng)比(bǐ)同(tóng)类(lèi)模(mó)型(xíng)要(yào)少(shǎo)得(de)多(duō)。
其(qí)核(hé)心(xīn)是(shì)一(yī)个(gè)名为(wèi) FastViTHD 的(de)混(hùn)合(hé)视(shì)觉(jué)编(biān)码(mǎ)器(qì)。苹(píng)果(guǒ)团(tuán)队(duì)表(biǎo)示(shì),该(gāi)编(biān)码(mǎ)器(qì)“专(zhuān)为(wèi)在(zài)高(gāo)分(fēn)辨(biàn)率(lǜ)图(tú)像(xiàng)上(shàng)实(shí)现(xiàn)高(gāo)效(xiào)的(de) VLM 性(xìng)能(néng)而(ér)设(shè)计(jì)”,其(qí)处(chù)理(lǐ)速(sù)度(dù)较(jiào)同(tóng)类(lèi)模(mó)型(xíng)提(tí)升(shēng) 3.2 倍(bèi),体(tǐ)积(jī)却(què)仅(jǐn)有(yǒu) 3.6 分之一。
亮点
FastViTHD 新型混合视觉编码器:专为高分辨率图像优化设计,可减少令牌输出量并显著缩短编码时间
最小模型版本性能对比:较 LLaVA-OneVision-0.5B 模型实现首词元(Token)响应速度提升 85 倍,视觉编码器体积缩小 3.4 倍
搭配 Qwen2-7B 大语言模型版本:使用单一(yī)图(tú)像(xiàng)编(biān)码(mǎ)器(qì)即(jí)超越 Cambrian-1-8B 等近期研究成果,首词元响应速度提升 7.9 倍
配套 iOS 演示应用:实机展示移动端模型(xíng)性(xìng)能(néng)表(biǎo)现(xiàn)
苹(píng)果(guǒ)技(jì)术(shù)团(tuán)队指出:“基于对图像分辨率、视觉延迟、词元数量与LLM 大小的综合效率分析,我们开发出 FastVLM—— 该模型在延迟、模型大小和准确性之间实现了最优权衡。”
该技术的应用场景指向苹果正在研发的智能眼镜类穿戴设备。多方信息显示,苹果计划于 2027 年推出对标 Meta Ray-Bans 的 AI 眼镜,同期或将发布搭载摄像头的 AirPods 设备。
FastVLM 的本地化处理能力可有效支持此类设备脱离云端实现实时视觉交互。IT之家查询获悉,MLX 框架允许开发者在 Apple 设备本地训练和运行模型,同时兼容主流 AI 开发语言。FastVLM 的推出证实苹果正构建完整的端侧 AI 技术生态。