LiteRT-LM 完整指南把大语言模型推理搬到手机、电脑和边缘设备【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LMLiteRT-LM 是 Google 开源的端侧大语言模型推理框架基于 C 构建让你不用依赖云端就能在 Android、iOS、Web 和桌面设备上跑 Gemma、Qwen 等模型。本文帮你快速判断它能不能用在你的项目里。它解决什么问题想让 App 里跑本地大模型过去要自己处理一大堆脏活模型文件怎么加载、不同操作系统怎么适配、CPU 和 GPU 怎么调度、聊天历史怎么拼成模型认识的格式、函数调用怎么解析……每换一个平台几乎重来一遍。LiteRT-LM 把这些统一收口底层基于 LiteRT 推理引擎上层提供对话管理、硬件加速、工具调用等现成能力你只需要一个.litertlm模型文件和几行代码就能在多种设备上得到行为一致的推理结果。它还内置了基于约束解码的结构化输出机制工具调用的 JSON 解析、格式约束这类容易翻车的细节由框架兜底。核心能力速览一套 C 内核多语言 API 全平台覆盖整个引擎用可移植的 C 写成上层再包出不同语言的接口Python 和 Kotlin 已经稳定C 面向高性能原生集成Swift 和 JavaScript含浏览器环境处于早期预览社区还有 Flutter 方案。模型侧支持 Gemma、Llama、Phi-4、Qwen 等家族预编译产物覆盖 Android、iOS、Linux、macOS、Windows 甚至树莓派各平台的预编译库都在 prebuilt/ 目录里集成时不用自己交叉编译。GPU/NPU 加速与多模态开箱即用推理时可以选择 GPU 或 NPU 加速器仓库自带各平台的加速委托预编译库GPU、OpenCL、Metal、WebGPU 等新加的 YNNPACK 委托还在 Linux arm64 上做了实验性支持。模型也不只是聊天它支持视觉和音频输入仓库里 omni/ 目录就是配套的 ASR 语音识别和 TTS 语音合成引擎能搭出带耳朵和嘴巴的完整端侧对话管道。内置函数调用给模型接上真实工具做 Agent 类应用最头疼的是让模型可靠地调工具。LiteRT-LM 把这件事做成了标准流程你用 JSON Schema 声明工具框架负责把声明喂给模型、检测模型输出的调用字符串、解析成结构化 JSON 交回给你的应用执行再把结果拼回去继续生成。对应的概念文档在 docs/api/cpp/tool-use.md如果想深入限制模型输出格式比如强制输出合法 JSON 或 SQLruntime/components/constrained_decoding/ 下的约束解码实现值得读一读。数据怎么看官方给出的参考数据tokens/sec数值越高越快模型设备后端预填充速度解码速度Gemma3-1BMacBook Pro (M3)CPU603.883.0Gemma3-1BSamsung S24 UltraCPU379.755.9Gemma3-1BSamsung S24 UltraGPU2369.052.5Gemma3n-E2BMacBook Pro (M3)CPU232.527.6Gemma3n-E2BSamsung S24 UltraGPU816.415.6Gemma3n-E4BSamsung S24 UltraGPU548.09.4用大白话讲1B 小模型在手机上解码约 55 token/秒也就是每秒能吐出几十个字日常问答的流畅度已经接近即时响应。开 GPU 后长提示的预填充能快 6 倍左右意味着塞给模型一段长文档再提问时等待首字的时间大幅缩短。代价是模型越大越吃硬件——E4B 在手机上解码掉到个位数适合对质量要求高、能接受慢一点的场景。选型经验手机端优先 1B~2B 档桌面端可以摸到更大模型。适合谁、不适合谁适合做 Android/iOS/桌面/浏览器端 AI 功能的开发者想本地跑模型又懒得自己搭推理栈的团队以及树莓派等 IoT 场景的尝鲜者。Python 和 Kotlin API 都是稳定状态上手风险最低。不适合需要超大参数模型实时交互的场景——端侧硬件摆在那儿E4B 级别的模型在手机上解码都不快更大的模型请留在云端对 API 稳定性要求极苛刻的生产项目也要留意Swift、JavaScript 接口还在早期预览版本间可能有变动此外它主要面向 LLM 推理编排不是训练/微调框架模型转换和构建工具链python/litert_lm_builder/有一定学习成本。上手路径最快的体验方式是命令行装一个uv执行uv tool install litert-lm然后一条litert-lm run命令加一个 Hugging Face 模型地址终端里就能直接对话全程不写代码。要进应用的话按你熟悉的语言走Kotlin 用户在 docs/api/kotlin/getting_started.md 对应的 Kotlin 指南里通过 Gradle 加依赖即可C 集成参考 docs/api/cpp/ 下的对话 API 文档各模型的提示词模板和元数据配置都放在 models/ 目录里可以直接看。想自己编译的话docs/getting-started/cmake.md 讲了 CMake 构建路径官方推荐还是用 Bazel。端侧大模型推理正在从能不能跑走向跑得多快、接得多少外设LiteRT-LM 是目前开源方案里工程完成度相当高的一个。如果你手上正好有个需要离线 AI 能力的产品不妨先用 CLI 跑个 Gemma 3n E2B 试试手感再决定要不要正式接入。【免费下载链接】LiteRT-LMLiteRT-LM is Googles production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.项目地址: https://gitcode.com/GitHub_Trending/li/LiteRT-LM创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
企业数字化 ERP 产品动态
相关推荐
PocketFlow 向量数据库实战指南:7 大主流向量检索方案选型对比与 Python 接入代码 人工智能大模型AI Agent工作流自动化RAG 【免费下载链接】PocketFlow Pocket Flow: 100-line LLM framework. Let Agents build Agents! 项目地址: https://gitcode.com/gh_mirrors/poc/PocketFlow 点击查看 免费下载 导读
在 LLM 应用中,向量检索是 R… · 2026/9/24 17:10:01
2026年成都GEO服务商横评:五类机构的商业模式、能力边界与适配场景 打开豆包或者DeepSeek,问一句"成都哪家做品牌营销比较靠谱",回答里出现的几个名字,正在影响一批企业的采购判断。对成都企业来说,问题已经不是要不要做GEO,而是在五种不同形态的服务机构之间,怎么… · 2026/9/24 17:09:55
PyMuPDF 版本变更日志全解析:从 1.9.1 到 1.28.2 的功能演进与升级决策指南 图像处理 【免费下载链接】PyMuPDF PyMuPDF is a high performance Python library for data extraction, analysis, conversion & manipulation of PDF (and other) documents. 项目地址: https://gitcode.com/gh_mirrors/py/PyMuPDF 点击查看 免费下载 PyMuP… · 2026/9/24 17:09:49
边缘AI应用:事关家庭隐私,家用AI摄像头的哪些AI任务在本地完成 家用AI摄像头的隐私风险不在于有没有AI,而是要弄清楚AI推理发生在哪里——是在摄像头本地芯片上完成,还是把视频传到云端处理。而本地推理的任务之所以安全,是因为摄像头拍到的原始视频没有离开设备,你的摄像头安装在家里… · 2026/9/24 17:53:30
第六篇:《Codex 桌面应用实战:多智能体并行协作》 如果说 Codex CLI 是“一个智能体在终端里干活”,那么 Codex 桌面应用就是“一个指挥中心,同时调度多个智能体并行工作”。2026 年 2 月,OpenAI 推出了 Codex macOS 桌面应用,将其定位为 “代理指挥中心”(Command Cen… · 2026/9/24 17:53:23
第五篇:《Codex CLI 安装与快速上手:从零到第一个任务》 Codex 的桌面应用提供了直观的图形界面,但如果你想在终端中直接委托任务,或者需要在 CI/CD 流水线中集成 AI 编码能力,Codex CLI 才是真正的起点。它是 OpenAI 官方开源的终端 AI 编程智能体,用 Rust 实现,能在你的项目… · 2026/9/24 17:53:23
开工才发现缺料,BOM、库存、采购怎么串起来?物料齐套系统选型 制造业里最让人头疼的场面之一,就是工单已经下发了、工人已经到位了,开工才发现——缺料。A料库存不够,B料采购还没到,C料在仓库里但没人知道在哪。生产计划被迫中断,交期一拖再拖。 这个问题的根源,不是库… · 2026/9/24 17:52:58
设备不会说话:一天里的七层证据 设备不会说话:一天里的七层证据标签:有限状态机、互斥租约、生产者-消费者、内存池、构建指纹、软限位、图像显示链路、统计基线、git 语义
引言:设备不会说话。它不会告诉你"我现在很忙",也不会解释"刚才那次为什… · 2026/9/24 17:52:58
毕业设计说明书和毕业论文:图纸说明先落在谁那里,改一次要回头动几处 说明书与论文这两份文本的分工,不看你把哪段写进哪一本,而看这一处内容改一次要连带动几份。图纸说明大多两条船都踩:动一处就得回头核另一处。文末两项能力可以免费用起来:一项先把章节骨架整段搭起来,一项把图表公式… · 2026/9/24 17:52:58
基于YOLOv8的渔船作业监控系统:从环境搭建到边缘部署全流程 简介:这是一套面向计算机、人工智能、自动化等专业学生与教师的毕业设计级项目资源,围绕YOLOv8实现渔船作业监控系统,可用于毕设、课程设计、大作业或项目立项演示。压缩包共97个文件,约24.21MB,以70个Python源码文件为… · 2026/9/24 0:00:13
1D-CNN时间序列建模实战:从Conv1d原理到工业落地 简介:面向时间序列数据建模的一维卷积神经网络完整实现,适合深度学习入门者及需要快速验证时序模型的研究者,能够从音频、文本、传感器或股价等序列中挖掘局部特征与时间依赖。压缩包体积很小,只有3KB,内含3个Python脚… · 2026/9/24 0:00:26
柔软的L:汉语语流中被忽视的舌肌张力控制 1. 这个“L”不是字母表里的L,而是舌尖上的L最近在几个方言群和语音教学社群里,反复看到有人发一句:“也说字母L:柔软的长舌”。初看以为是英语发音课笔记,点开才发现全是方言爱好者、播音系学生、语言康复师甚至戏曲演… · 2026/9/24 0:00:44