☰
Google AI Edge Gallery 使用指南:在手机上部署离线大模型,从安装到自定义任务
2026/9/26 3:01:19 网站建设 项目流程

Google AI Edge Gallery 使用指南:在手机上部署离线大模型,从安装到自定义任务

【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery

公司里的客户对话、生产记录这类敏感数据,往往不允许发到外部服务器;而工厂产线、仓库等现场环境,网络也未必稳定——这两个问题都指向同一个需求:能不能把 AI 直接装在设备上跑?Google AI Edge Gallery 就是为此做的一款应用,它让开源大模型(LLM,Large Language Model,即大语言模型)在你的手机或平板上本地推理,处理对话、图片识别、语音转写和移动设备控制等任务。模型加载完成后,所有功能断网也能用,你的提问和图片不会离开设备。

一、安装要求与获取方式

  • Android 端:系统需为 Android 12 及以上版本,可直接从 Google Play 商店安装;不便访问商店的企业设备,可从项目最新 release 下载 APK 自行安装。
  • 内存方面,官方建议设备至少配备 6GB RAM,否则加载和推理大模型会比较吃力。
  • 项目计划于 2026 年初在 iOS App Store 上线,macOS 版本也已提供下载。

二、端侧推理的技术栈

应用底层的推理链条由三层组成:

  1. Google AI Edge API——谷歌提供的设备端机器学习核心接口,负责与硬件打交道;
  2. LiteRT——一个轻量级运行时,可以理解为负责在手机上高效执行模型计算的"引擎",它对模型做了针对性优化;
  3. LLM 推理层——真正运行大语言模型的部分,所有推理都在设备本地完成,不产生云端调用。

正因为这套组合完全跑在本机硬件上,隐私保护和离线可用性是"架构自带的",而不是额外附加的功能。

三、部署与管理自定义模型

模型的下载、切换和删除集中在模型管理模块完成,其源码位于 ModelManagerViewModel.kt。使用上支持三种路径:

  • 从内置列表选择开源模型,通过 Hugging Face 集成直接发现并下载;
  • 导入自定义模型,格式为 LiteRT 的.litertlm文件,适合已经用其他工具转换好模型的团队;
  • 通过模型白名单机制,限制组织内设备可分发的模型范围,便于统一管理。

如果要从源码构建应用,仓库根目录的 DEVELOPMENT.md 有完整的本地构建说明;需要 clone 时使用 https://gitcode.com/GitHub_Trending/gallery44/gallery 即可。

四、四个典型使用场景

多轮对话与智能客服:Agent Chat 支持多轮上下文,并内置"思考模式",可以展开查看模型逐步推理的过程,目前从 Gemma 4 系列模型开始支持。

图片识别与分析:用摄像头拍摄或从相册选图,模型可识别物体、解答视觉谜题、生成详细描述,全部离线完成。

音频转写与翻译:语音录音可实时转成文字并翻译,基于设备端语言模型处理,适合没有网络的会议记录场景。

设备控制:Mobile Actions 功能利用 FunctionGemma 270m 微调模型,实现离线的设备操作和自动化任务。

五、扩展能力:接入自定义技能

🔧 应用提供了 Agent Skills 技能框架,用来给模型"加装工具"。一个技能就是一个文件夹,其中的 SKILL.md 描述技能名称和用途,模型判断任务相关时会自行调用。技能分三类:纯文本型(给模型注入角色或知识)、JavaScript 型(在隐藏 webview 中执行脚本,例如生成二维码、画交互地图)、原生型(调用系统能力,如发邮件、发短信)。内置和社区技能示例见 skills 目录。

面向需要自研功能模块的团队,应用采用自定义任务(Custom Task)架构组织代码,各场景模块位于 customtasks 目录,开发者可以参照现有模块的结构实现自己的任务。

六、查看性能指标与基准测试

部署前的核心问题是"我的设备跑得动哪个模型、速度如何"。应用内置 Benchmark 基准测试功能,可以测量两个关键指标:

  • TTFT(Time To First Token):从发出请求到吐出第一个字所用的时间,反映响应快慢;
  • 解码速度:模型持续生成文字的速度,决定长回答的等待时间。

测试在真实硬件上运行,因此结果比纸面参数更有参考价值。选模型时先跑一轮基准测试,再决定用哪一版,是较稳妥的做法。另外应用还提供 Prompt Lab 实验区,可调节 temperature、top-k 等参数,专门测试提示词效果。

七、使用边界与注意事项

最后需要明确几点限制,避免期望错位:

  • 当前版本仍处于实验性 Beta 阶段,功能和稳定性会持续变动,反馈渠道在项目的 issue 区;
  • 端侧模型的体积和上下文都受手机硬件限制,官方文档提到端侧模型的上下文窗口一般在 4k~10k token 量级,长文档类任务要提前做拆分;
  • 应用启用 GPU 加速来降低延迟,但部分手机 GPU 内核在浮点高精度运算上与 CPU 的一致性有差异,涉及大量数值计算的工具调用可能出现精度偏差;
  • 时间线方面,iOS 版本计划 2026 年初上线,依赖 App Store 分发渠道的组织需要留意这个节点。

一句话总结:Google AI Edge Gallery 解决的是"数据不出设备"和"断网也能用 AI"两个现实问题,代价是需要按设备硬件挑选合适的模型规格。

【免费下载链接】galleryA gallery that showcases on-device ML/GenAI use cases and allows people to try and use models locally.项目地址: https://gitcode.com/GitHub_Trending/gallery44/gallery

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询