手机根本跑不动7B模型,Gemma 4 E2B和Qwen 3.6谁才是真·端侧轻量之王?

源自39位全网作者

04-04 09:53

精选参考来源

1
谷歌Gemma 4深夜突降,31B爆杀20倍巨头!手机跑全血「龙虾」
2
# 谷歌 DeepMind Gemma 4 重磅发布:Agent Skills 让手机彻底成为本地 AI 代理运行时 # 2026 年 4 月 2 日,Google DeepMind 开发者体验负责人 Omar Sanseviero(@osanseviero)在 X 平台发布重磅消息: As part of the Gemma 4 release, we're launching Agent Skills: an Android app experience where you can import different skills and have Gemma 4 E2B reason and use the skills! Running entirely in the phone, available in the Google PlayStore. Try it now! 随后补充下载链接与官方博客地址。本帖附带 116 秒演示视频,迅速引发全球开发者与 AI 爱好者热议,浏览量已超 16 万次。 同日,Google Developers Blog 发布官方文章《Bring state-of-the-art agentic skills to the edge with Gemma 4》,详细阐述 Gemma 4 模型家族及 Agent Skills 功能。本文基于 X 原始帖文(含完整视频演示)与官方博客全文内容无损完整呈现,深度拆解技术细节、演示案例、实现原理、开发者生态及行业意义,为中文读者提供一篇零信息损失、系统性的技术战略分析。 # 一、Gemma 4 模型家族:开源 Agentic AI 的新基准 # Google DeepMind 于 2026 年 4 月 2 日正式推出 Gemma 4 模型家族,以 Apache 2.0 许可开源。Gemma 4 专为边缘设备与移动场景优化,重新定义了本地硬件上的 AI 能力。 核心亮点(直接来自官方博客): 1. 多步规划与自主行动:无需专门微调,即可实现复杂任务链与自主代理。 2. 离线代码生成与音视频处理:支持 140+ 语言,面向全球开发者。 3. 视觉处理与多模态能力:支持图像、视频处理。 4. Gemma 4 E2B / E4B 变体:专为 Agent Skills 设计,E2B 模型在部分设备上峰值内存占用低于 1.5GB。 开发者可通过 Android AICore Developer Preview 或 Google AI Edge 工具链,在移动、桌面、边缘设备上快速构建代理式(Agentic)应用。 # 二、Agent Skills 核心机制:Google AI Edge Gallery 中的本地代理运行时 # Google AI Edge Gallery 应用已在 Android(Google Play Store)和 iOS(App Store)上线,支持完全本地运行的 AI 体验。今天正式推出 Agent Skills,这是首批在设备上实现多步、自主代理工作流的应用程序,由 Gemma 4 驱动。 Agent Skills 四大核心能力(官方博客原文): 1. 知识库增强(Augment the knowledge base):Gemma 4 可通过技能接入训练数据之外的信息。例如,构建 Wikipedia 技能,让代理回答任何百科问题。 2. 生成丰富交互内容(Produce rich, interactive content):将段落、视频转为摘要、闪卡,或将数据转为交互图表/图形。例如,基于用户语音输入的睡眠日志,技能自动生成每日睡眠与情绪趋势图表。 3. 扩展核心能力(Expand Gemma 4's core capabilities):集成其他模型,如文本转语音、图像生成、音乐合成。例如,上传照片后,技能分析氛围并自动匹配播放完美契合心情的音乐。 4. 端到端复杂工作流(Create comprehensive end-to-end experiences):用户通过与 Gemma 4 的自然语言对话完成多步任务,无需切换多个 App。例如,构建描述动物并播放叫声的完整应用。 技能开发与格式:每个技能本质上是 SKILL.md 文件(含提示词)+ 可选 JS 脚本(运行于隐藏 WebView)。JS 脚本拥有完整 fetch() API,可调用外部服务;原生 Intent 处理邮件、SMS;API Key 通过系统原生对话框输入,永不进入 LLM Prompt,保障隐私与安全。 技能支持 URL 导入、GitHub Discussions 社区分享,或本地 ADB 推送。Google AI Edge Gallery GitHub 仓库(http://t.cn/A6eG1Bp2)提供 /skills 目录模板,开发者可快速创建并在 Discussions 分类下分享技能。 # 三、LiteRT-LM 运行时:极致性能与跨平台支持 # 为让 Gemma 4 在各类设备上高效运行,Google 推出 LiteRT-LM —— 在 LiteRT 基础上新增 GenAI 专用库,集成 XNNPack 与 ML Drift。 关键特性(官方实测数据): - 极致内存优化:Gemma 4 E2B 在部分设备上内存占用 <1.5GB(2-bit / 4-bit 量化 + 内存映射逐层嵌入)。 - 约束解码:确保结构化、可预测输出,适用于生产级工具调用。 - 动态上下文:支持最高 128K 上下文长度,CPU/GPU 动态切换。 - 高性能处理:处理 4000 个输入 token(跨 2 个不同技能)耗时不到 3 秒。 - 边缘设备表现:Raspberry Pi 5 上预填充吞吐量 133 tokens/s,解码 7.6 tokens/s,可用于离线智能家居、语音助手、机器人。 跨平台支持: - 移动端:Android 12+ 与 iOS 17+,CPU/GPU 加速;Android 还可通过 AICore 系统级调用优化后的 Gemma 4。 - 桌面/Web:Windows、Linux、macOS(Metal)、WebGPU。 - IoT/机器人:Raspberry Pi 5、Qualcomm IQ8 NPU。 - 新工具:litert-lm Python 包 + CLI,支持无代码实验、工具调用,适用于 Linux、macOS、Raspberry Pi。 # 四、视频演示与实际体验(116 秒官方演示完整对应) # X 帖附带视频及 Google AI Edge Gallery 应用演示,直观展示 Agent Skills 流畅性: - 技能管理界面:一键导入、开启/关闭、搜索技能。 - Gemma-4-E2B-it 模型(GPU 加速)实时推理与技能调用。 - 演示案例涵盖 Wikipedia 查询、图表生成、照片配乐、动物介绍与叫声播放等,与博客四大能力完全对应。 整个过程100% 本地运行、无需联网、无数据泄露,充分验证“手机即完整 Agent 运行时”的理念。 # 五、开发者生态与开源贡献 # - 技能开发指南:GitHub 仓库提供完整模板与示例。 - 社区分享:通过 GitHub Discussions 提交技能,官方鼓励开发者构建并分享。 - 开源地址:Google AI Edge Gallery 已完全开源(Apache 2.0),支持模型管理、基准测试、Thinking Mode 等功能。 - 贡献与反馈:X 社区已有开发者分享自定义技能、Pixel 设备适配、Mac Mini 加载方案,同时指出部分设备(如 Pixel 10 Pro Fold)偶发兼容性问题,Google 通过 GitHub 快速迭代。 X 回复亮点(部分): - “skills as the app model for on-device AI agents. this is where the unbundling starts.” - “This is basically the Gemini Nano 4 developer preview.” - iOS 用户已可通过 App Store 下载体验。 # 六、战略意义:隐私、安全、普惠与产业重塑 # 1. 隐私革命:所有推理本地完成,敏感数据永不离开设备,特别适合科研、医疗、企业场景。 2. 离线可用性:打破云端依赖,真正实现“随时随地”代理工作流。 3. 开发者普惠:2B\~4B 小模型即可完成复杂任务,Play Store / App Store 一键安装即可体验 SOTA 代理能力。 4. 产业冲击:传统 App 可能被“技能超市”替代;手机从“查询机”升级为“执行机”;边缘 AI 与 Agentic AI 融合,将加速机器人、智能硬件、个人助理爆发。 5. 与云端互补:本地 Gemma 4 可作为 Gemini Nano 4 的开发者预览,未来无缝迁移。 # 七、立即体验与深入阅读 # - Android:Google Play Store 搜索 “Google AI Edge Gallery” 或直接访问 http://t.cn/AXIRZXRS - iOS:App Store 搜索 “Google AI Edge Gallery” 或直接访问 http://t.cn/AXIRZXRK - 开发者:GitHub http://t.cn/A6eG1Bp2 下载源码、构建自定义技能 - 官方博客:http://t.cn/AXIRZXR9 # 总结 # Gemma 4 + Agent Skills 并非简单模型更新,而是移动 AI 的一次范式跃迁。它把“代理”从云端拉到掌心,把“技能”变成可组合的乐高积木,让每一位用户与开发者都能在本地构建属于自己的智能未来。这不仅仅是 Google 的技术里程碑,更是整个边缘智能时代正式开启的信号。 (本文基于 X 原始帖文全文、116 秒官方视频描述及 Google Developers Blog 完整内容撰写) http://t.cn/AXIRZa7v
全部
来源
内容由AI生成

精选参考来源

1. 谷歌Gemma 4深夜突降,31B爆杀20倍巨头!手机跑全血「龙虾」

2. # 谷歌 DeepMind Gemma 4 重磅发布:Agent Skills 让手机彻底成为本地 AI 代理运行时 # 2026 年 4 月 2 日,Google DeepMind 开发者体验负责人 Omar Sanseviero(@osanseviero)在 X 平台发布重磅消息: As part of the Gemma 4 release, we're launching Agent Skills: an Android app experience where you can import different skills and have Gemma 4 E2B reason and use the skills! Running entirely in the phone, available in the Google PlayStore. Try it now! 随后补充下载链接与官方博客地址。本帖附带 116 秒演示视频,迅速引发全球开发者与 AI 爱好者热议,浏览量已超 16 万次。 同日,Google Developers Blog 发布官方文章《Bring state-of-the-art agentic skills to the edge with Gemma 4》,详细阐述 Gemma 4 模型家族及 Agent Skills 功能。本文基于 X 原始帖文(含完整视频演示)与官方博客全文内容无损完整呈现,深度拆解技术细节、演示案例、实现原理、开发者生态及行业意义,为中文读者提供一篇零信息损失、系统性的技术战略分析。 # 一、Gemma 4 模型家族:开源 Agentic AI 的新基准 # Google DeepMind 于 2026 年 4 月 2 日正式推出 Gemma 4 模型家族,以 Apache 2.0 许可开源。Gemma 4 专为边缘设备与移动场景优化,重新定义了本地硬件上的 AI 能力。 核心亮点(直接来自官方博客): 1. 多步规划与自主行动:无需专门微调,即可实现复杂任务链与自主代理。 2. 离线代码生成与音视频处理:支持 140+ 语言,面向全球开发者。 3. 视觉处理与多模态能力:支持图像、视频处理。 4. Gemma 4 E2B / E4B 变体:专为 Agent Skills 设计,E2B 模型在部分设备上峰值内存占用低于 1.5GB。 开发者可通过 Android AICore Developer Preview 或 Google AI Edge 工具链,在移动、桌面、边缘设备上快速构建代理式(Agentic)应用。 # 二、Agent Skills 核心机制:Google AI Edge Gallery 中的本地代理运行时 # Google AI Edge Gallery 应用已在 Android(Google Play Store)和 iOS(App Store)上线,支持完全本地运行的 AI 体验。今天正式推出 Agent Skills,这是首批在设备上实现多步、自主代理工作流的应用程序,由 Gemma 4 驱动。 Agent Skills 四大核心能力(官方博客原文): 1. 知识库增强(Augment the knowledge base):Gemma 4 可通过技能接入训练数据之外的信息。例如,构建 Wikipedia 技能,让代理回答任何百科问题。 2. 生成丰富交互内容(Produce rich, interactive content):将段落、视频转为摘要、闪卡,或将数据转为交互图表/图形。例如,基于用户语音输入的睡眠日志,技能自动生成每日睡眠与情绪趋势图表。 3. 扩展核心能力(Expand Gemma 4's core capabilities):集成其他模型,如文本转语音、图像生成、音乐合成。例如,上传照片后,技能分析氛围并自动匹配播放完美契合心情的音乐。 4. 端到端复杂工作流(Create comprehensive end-to-end experiences):用户通过与 Gemma 4 的自然语言对话完成多步任务,无需切换多个 App。例如,构建描述动物并播放叫声的完整应用。 技能开发与格式:每个技能本质上是 SKILL.md 文件(含提示词)+ 可选 JS 脚本(运行于隐藏 WebView)。JS 脚本拥有完整 fetch() API,可调用外部服务;原生 Intent 处理邮件、SMS;API Key 通过系统原生对话框输入,永不进入 LLM Prompt,保障隐私与安全。 技能支持 URL 导入、GitHub Discussions 社区分享,或本地 ADB 推送。Google AI Edge Gallery GitHub 仓库(http://t.cn/A6eG1Bp2)提供 /skills 目录模板,开发者可快速创建并在 Discussions 分类下分享技能。 # 三、LiteRT-LM 运行时:极致性能与跨平台支持 # 为让 Gemma 4 在各类设备上高效运行,Google 推出 LiteRT-LM —— 在 LiteRT 基础上新增 GenAI 专用库,集成 XNNPack 与 ML Drift。 关键特性(官方实测数据): - 极致内存优化:Gemma 4 E2B 在部分设备上内存占用 <1.5GB(2-bit / 4-bit 量化 + 内存映射逐层嵌入)。 - 约束解码:确保结构化、可预测输出,适用于生产级工具调用。 - 动态上下文:支持最高 128K 上下文长度,CPU/GPU 动态切换。 - 高性能处理:处理 4000 个输入 token(跨 2 个不同技能)耗时不到 3 秒。 - 边缘设备表现:Raspberry Pi 5 上预填充吞吐量 133 tokens/s,解码 7.6 tokens/s,可用于离线智能家居、语音助手、机器人。 跨平台支持: - 移动端:Android 12+ 与 iOS 17+,CPU/GPU 加速;Android 还可通过 AICore 系统级调用优化后的 Gemma 4。 - 桌面/Web:Windows、Linux、macOS(Metal)、WebGPU。 - IoT/机器人:Raspberry Pi 5、Qualcomm IQ8 NPU。 - 新工具:litert-lm Python 包 + CLI,支持无代码实验、工具调用,适用于 Linux、macOS、Raspberry Pi。 # 四、视频演示与实际体验(116 秒官方演示完整对应) # X 帖附带视频及 Google AI Edge Gallery 应用演示,直观展示 Agent Skills 流畅性: - 技能管理界面:一键导入、开启/关闭、搜索技能。 - Gemma-4-E2B-it 模型(GPU 加速)实时推理与技能调用。 - 演示案例涵盖 Wikipedia 查询、图表生成、照片配乐、动物介绍与叫声播放等,与博客四大能力完全对应。 整个过程100% 本地运行、无需联网、无数据泄露,充分验证“手机即完整 Agent 运行时”的理念。 # 五、开发者生态与开源贡献 # - 技能开发指南:GitHub 仓库提供完整模板与示例。 - 社区分享:通过 GitHub Discussions 提交技能,官方鼓励开发者构建并分享。 - 开源地址:Google AI Edge Gallery 已完全开源(Apache 2.0),支持模型管理、基准测试、Thinking Mode 等功能。 - 贡献与反馈:X 社区已有开发者分享自定义技能、Pixel 设备适配、Mac Mini 加载方案,同时指出部分设备(如 Pixel 10 Pro Fold)偶发兼容性问题,Google 通过 GitHub 快速迭代。 X 回复亮点(部分): - “skills as the app model for on-device AI agents. this is where the unbundling starts.” - “This is basically the Gemini Nano 4 developer preview.” - iOS 用户已可通过 App Store 下载体验。 # 六、战略意义:隐私、安全、普惠与产业重塑 # 1. 隐私革命:所有推理本地完成,敏感数据永不离开设备,特别适合科研、医疗、企业场景。 2. 离线可用性:打破云端依赖,真正实现“随时随地”代理工作流。 3. 开发者普惠:2B\~4B 小模型即可完成复杂任务,Play Store / App Store 一键安装即可体验 SOTA 代理能力。 4. 产业冲击:传统 App 可能被“技能超市”替代;手机从“查询机”升级为“执行机”;边缘 AI 与 Agentic AI 融合,将加速机器人、智能硬件、个人助理爆发。 5. 与云端互补:本地 Gemma 4 可作为 Gemini Nano 4 的开发者预览,未来无缝迁移。 # 七、立即体验与深入阅读 # - Android:Google Play Store 搜索 “Google AI Edge Gallery” 或直接访问 http://t.cn/AXIRZXRS - iOS:App Store 搜索 “Google AI Edge Gallery” 或直接访问 http://t.cn/AXIRZXRK - 开发者:GitHub http://t.cn/A6eG1Bp2 下载源码、构建自定义技能 - 官方博客:http://t.cn/AXIRZXR9 # 总结 # Gemma 4 + Agent Skills 并非简单模型更新,而是移动 AI 的一次范式跃迁。它把“代理”从云端拉到掌心,把“技能”变成可组合的乐高积木,让每一位用户与开发者都能在本地构建属于自己的智能未来。这不仅仅是 Google 的技术里程碑,更是整个边缘智能时代正式开启的信号。 (本文基于 X 原始帖文全文、116 秒官方视频描述及 Google Developers Blog 完整内容撰写) http://t.cn/AXIRZa7v

3. 超越ORION!CoT4AD:显式思维链推理VLA模型(北大最新)

4. 黄仁勋罕见长文:未来10年,AI拼的到底是什么? #黄仁勋 #英伟达 #gtc #科技改变生活

5. 谷歌又放大招了Gemma4发布后,谷歌一口气放出了四个版本:手机端 E2B/E4B 轻量版、26B MoE 极速版、31B 旗舰版。 尤其是31B 旗舰版,Arena AI 开源榜全球第三的位置相当惊人,小参数直接越级干翻体量20倍的对手,以前要机房集群才能跑的高端能力,现在消费级显卡就能本地跑通。不过,个人觉得31B版和国内顶流开源模型其实各有胜负,并非碾压全场 #ai前沿速递##微博兴趣创作计划##how i ai#

6. 昨天谷歌发了 Gemma 4 开放权重模型系列,升级挺猛的。一共四个版本,除了端侧轻量版,还头一回上了 MoE 架构的 26B 模型。全系支持多模态,能看懂图片听懂语音,自带推理思考功能,上下文直接拉到了 25 万。最香的是改用 Apache 2.0 彻底开源了。感觉谷歌这次是真的放开手脚了,那个 26B 单卡就能跑,性价比挺高,可以试着本地部署跑个试试看。#谷歌发布Gemma4开源大模型# #微博跨域计划# #AI创造营#

7. #Gemma 4:字节对字节,最强大的开源模型#发布日期:2026 年 4 月 2 日 作者:Clement Farabet(Google DeepMind 研究副总裁)、Olivier Lacombe(Google DeepMind 产品组经理)Google DeepMind 今日正式发布 Gemma 4,这是迄今为止最强大的开源模型家族。Gemma 4 以“字节对字节”(byte for byte)的方式定义了开源模型的新基准,专为高级推理(reasoning)和代理式工作流(agentic workflows)而构建。它在保持轻量级和高效率的同时,实现了前沿级别的智能表现,适用于从移动设备到服务器的各种部署场景。Gemma 4 系列模型在 Arena.ai 的聊天竞技场(chat arena)中展现出领先的开放模型性能-vs-大小表现(数据截至 2026 年 4 月 1 日)。这些模型经过大量不同数据集和指标的全面评估,涵盖文本生成的各个方面。更多详细基准测试请参阅官方模型卡。Gemma 4 以 Apache 2.0 许可发布是一个巨大的里程碑。我们非常兴奋能在首日就在 Hugging Face 上全面支持 Gemma 4 系列模型。 ——Clément Delangue,Hugging Face 联合创始人兼 CEO#Gemma 4 的核心亮点与架构创新#Gemma 4 是 Google DeepMind 构建的开源模型家族,采用多模态设计,支持文本和图像输入(小型模型还原生支持音频),并生成文本输出。本次发布包括预训练和指令微调(instruction-tuned)两种变体,上下文窗口最高可达 256K tokens,并支持超过 140 种语言的多语言能力。Gemma 4 同时提供 Dense(密集)和 Mixture-of-Experts(MoE,混合专家)两种架构,特别适合文本生成、编程和复杂推理任务。模型共有四种尺寸:E2B、E4B、26B A4B 和 31B,可灵活部署于高端手机、笔记本电脑乃至服务器环境,真正实现 AI 的普惠。#关键能力与架构升级#- 强大推理能力:全系列模型均设计为高性能推理器,支持可配置的“思考模式”(thinking mode)。 - 扩展多模态支持:处理文本、图像(支持可变宽高比和分辨率,所有模型均支持)、视频,以及音频(E2B 和 E4B 模型原生支持)。 - 多样化高效架构:提供 Dense 和 MoE 变体,不同尺寸可根据部署需求灵活选择。 - 设备端优化:小型模型专为笔记本和移动设备本地高效执行而设计。 - 超长上下文窗口:小型模型支持 128K tokens,中型模型支持 256K tokens。 - 增强编程与代理能力:编程基准显著提升,并原生支持函数调用(function-calling),可驱动高度自主的 AI 代理。 - 原生系统提示支持:引入系统角色(system role)支持,实现更结构化、可控的对话。Gemma 4 采用混合注意力机制(hybrid attention),在局部滑动窗口注意力(local sliding window attention)和全局注意力(full global attention)之间交替,确保最后一层始终为全局注意力。这种设计在保持轻量级模型的速度和低内存占用同时,保留了处理复杂长上下文任务所需的深度感知能力。为优化长上下文内存,全局层使用统一的 Key-Value,并应用比例 RoPE(Proportional RoPE,p-RoPE)。#模型概览#Gemma 4 针对从移动/边缘设备(E2B、E4B)到消费级 GPU 和工作站(26B A4B、31B)的部署场景,均提供前沿级性能,特别适用于推理、代理工作流、编程和多模态理解。#Dense 模型规格#属性 E2B E4B 31B Dense总参数量 2.3B 有效(含嵌入 5.1B) 4.5B 有效(含嵌入 8B) 30.7B层数 35 42 60滑动窗口 512 tokens 512 tokens 1024 tokens上下文长度 128K tokens 128K tokens 256K tokens词汇表大小 262K 262K 262K支持模态 文本、图像、音频 文本、图像、音频 文本、图像视觉编码器参数 \~150M \~150M \~550M音频编码器参数 \~300M \~300M 无音频说明:E2B 和 E4B 中的“E”代表“Effective”(有效)参数。小型模型采用 Per-Layer Embeddings(PLE,每层嵌入)技术,通过为每个解码器层提供独立的微型嵌入表实现参数高效利用。这些嵌入表虽大,但仅用于快速查找,因此有效参数量远小于总参数量,特别适合设备端部署。#Mixture-of-Experts(MoE)模型规格#属性 26B A4B MoE总参数量 25.2B激活参数量 3.8B层数 30滑动窗口 1024 tokens上下文长度 256K tokens词汇表大小 262K专家数量 8 激活 / 128 总 + 1 共享支持模态 文本、图像视觉编码器参数 \~550M说明:26B A4B 中的“A”代表“Active”(激活)参数。在推理时仅激活约 4B 参数子集,使 MoE 模型的运行速度远高于其 26B 总参数暗示的速度,几乎相当于 4B 参数模型的速度,适合追求快速推理的场景。#基准测试结果#Gemma 4 在多个权威基准上展现出卓越性能(以下为指令微调模型结果,与前代 Gemma 3 27B 对比):基准测试 Gemma 4 31B Gemma 4 26B A4B Gemma 4 E4B Gemma 4 E2B Gemma 3 27B(无思考模式)MMLU Pro 85.2% 82.6% 69.4% 60.0% 67.6%AIME 2026(无工具) 89.2% 88.3% 42.5% 37.5% 20.8%LiveCodeBench v6 80.0% 77.1% 52.0% 44.0% 29.1%Codeforces ELO 2150 1718 940 633 110GPQA Diamond 84.3% 82.3% 58.6% 43.4% 42.4%Tau2(3 次平均) 76.9% 68.2% 42.2% 24.5% 16.2%HLE(无工具) 19.5% 8.7% - - -HLE(带搜索) 26.5% 17.2% - - -BigBench Extra Hard 74.4% 64.8% 33.1% 21.9% 19.3%MMMLU 88.4% 86.3% - - -(完整基准详见官方模型卡。Gemma 4 在编程、数学推理、通用知识等多个维度全面领先,尤其在长上下文和多模态任务上表现出色。)#使用指南与最佳实践##1. 采样参数(Sampling Parameters)#根据任务需求调整温度(temperature)、top-p 等参数,以平衡创造性和确定性。#2. 思考模式配置(Thinking Mode Configuration)#Gemma 4 支持显式思考模式,可显著提升复杂推理任务的表现。#3. 多轮对话(Multi-Turn Conversations)#利用长上下文窗口,支持更自然的持续对话。#4. 模态顺序(Modality Order)#图像/音频输入顺序会影响模型理解,建议按逻辑顺序提供。#5. 可变图像分辨率(Variable Image Resolution)#所有模型均支持动态分辨率,优化视觉理解效率。#6. 音频处理(Audio)#E2B/E4B 模型原生支持音频输入,适用于语音相关任务。#7. 音频与视频长度(Audio and Video Length)#建议控制输入长度以保持最佳性能和效率。#获取与部署#Gemma 4 采用 Apache 2.0 许可,完全开放商用。开发者可立即通过以下渠道获取:- Hugging Face:网页链接(首日完整支持) - GitHub:网页链接 - 官方文档:网页链接 - Google AI Studio / Vertex AI:快速原型开发与生产部署 - Google Cloud:已原生集成,支持大规模应用Gemma 4 还获得 vLLM、Google TPU、AMD GPU、Intel XPU 等主流推理引擎的首日支持,极大降低了部署门槛。#结语:开源 AI 的新纪元#Gemma 4 不仅是 Google DeepMind 开放模型战略的最新里程碑,更是整个开源 AI 生态的一次重大跃升。它证明了“智能 per 参数”的极致优化可以在不牺牲性能的前提下实现真正的普惠——从手机到云端,从个人开发者到企业团队,都能轻松触达前沿多模态推理能力。无论你是构建智能代理、开发代码助手、还是探索多模态应用,Gemma 4 都将为你提供强大、可靠且完全开放的基石。立即前往 Hugging Face 或官方文档,开始你的 Gemma 4 之旅吧!更多资源: - 官方模型卡:网页链接 - 发布博客: 网页链接/ - 许可协议:网页链接本文基于 Google 官方博客及 Gemma 4 模型卡完整内容翻译与整理,确保信息零损耗、无遗漏。所有技术细节、表格与基准数据均忠实还原自官方来源。 Google谷歌爱好者的微博视频

8. Google 的闭源模型是葛米妮,开源模型则是葛米妮她妈,葛妈。有人对比了刚刚发布的 Gemma 4 和 Qwen 3.5 的各项能力测试。要对比能力的话,只能拿 Gemma-4-31B 和 Qwen3.5-27B 来比,这么看 Gemma-4-31B 和 Qwen3.5-27B 好像各有千秋。但 Gemma-4-31B 比 Qwen3.5-27B 参数要多 4B。Gemma 4 这批里最有意思的可能是 E2B 和 E4B 这两个显然是为手机设计的模型,不知道塞进安卓后会产生什么涟漪。

9. 【#谷歌发布FunctionGemma#:把 AI 大模型能力“压缩”进手机,以后玩游戏全靠“吼”】谷歌于 12 月 18 日发布公告,宣布推出 FunctionGemma,是基于 Gemma 3 270M 微调的专用模型,目的是将强大的函数调用(Function Calling)能力引入手机等边缘设备。谷歌表示,随着行业从单纯的对话式接口转向主动式智能体(Agent),开发者对模型本地执行任务的需求日益迫切。FunctionGemma 正是为此而生,它不仅继承了 Gemma 系列的轻量化优势,更通过专项微调,让边缘设备(如智能手机和嵌入式系统)无需依赖云端算力,能够精准理解用户指令并调用相应功能。与通用大模型不同,FunctionGemma 专为“定制化”设计。它既能与人类自然对话,也能生成结构化的函数调用代码来指挥计算机。在 Google 进行的“移动操作”(Mobile Actions)测试中,该模型展现了惊人的可塑性:未经微调的基础版本准确率为 58%,而经过针对性微调后,其执行复杂指令(如“明天约午饭并添加到日历”、“帮我把昨天拍的美食发给老妈”)的准确率跃升至 85%。为了在算力和电池受限的边缘设备上流畅运行,FunctionGemma 采用了极致的轻量化设计。它利用 Gemma 的 256k 词表高效处理 JSON 数据和多语言输入,大幅降低了延迟。该模型目前已适配 NVIDIA Jetson Nano 等开发板及主流移动设备,甚至能作为“交通指挥官”,处理简单任务并将复杂逻辑路由至更大的 Gemma 3 27B 模型。为了降低开发门槛,谷歌为 FunctionGemma 构建了广泛的生态支持。开发者现在即可通过 Hugging Face、Kaggle 下载模型,并利用 Unsloth、Keras 或 NVIDIA NeMo 进行微调。在部署方面,该模型全面支持 LiteRT-LM、vLLM、Llama.cpp 和 Ollama 等工具。谷歌还同步发布了 TinyGarden 游戏演示和“移动操作”微调指南,展示了如何用自然语言控制虚拟农场或手机系统设置,帮助开发者快速构建属于自己的私有化、低延迟端侧智能体。(IT之家) 梨视频的微博视频

10. #科技先锋官# 当你在地下车库想调用AI实时翻译,却因没网陷入卡顿;当语音助手要等3秒才响应指令,端侧AI的不实用曾是很多安卓用户的痛点。谷歌Gemini Nano 3与安卓15的深度集成,正精准破解这些难题,让手机真正拥有本地思考的大脑。Gemini Nano 3集成安卓15解决了离线场景AI失灵的核心问题。此前端侧AI多依赖云端算力,无网络时翻译、摘要、语音交互等功能基本瘫痪。Gemini Nano 3依托安卓15的AICore系统服务,所有运算全在设备本地完成,无需数据上传云端,哪怕在山区、地铁等无信号区域,也能流畅实现实时翻译、离线文案生成等功能。Gemini Nano 3集成安卓15攻克了端侧推理延迟高、体验差的瓶颈。通过安卓15对NPU的深度优化,Gemini Nano 3离线推理速度提升2.5倍,语音指令响应、文本处理等操作几乎无延迟。这意味着,无论是整理会议纪要还是编辑图片,都能获得即呼即应的流畅体验,彻底告别等待卡顿。Gemini Nano 3集成安卓15还解决了隐私泄露与多终端适配难的问题。安卓15的私有计算核心架构,让Gemini Nano 3独立于其他应用运行,不存储操作数据,从根源上保障隐私安全。且适配Pixel、三星等多品牌终端,打破硬件壁垒,让更多安卓用户能享受到高质量端侧AI服务。Gemini Nano 3集成安卓15不仅让端侧AI从可用走向好用,更推动安卓生态迈入离线智能新时代,为后续车机协同、智能家居联动等场景打下基础。#AI创造营##AI创作热点##一条vlog回顾2025# 种斌Marco的微博视频

11. 【重磅解读】谷歌Gemma 4杀疯了:小模型性能炸裂,真正实现商用自由!

12. 如何评价 Google 发布的开源大模型 Gemma4?使用体验怎么样?

13. 谷歌Gemma 4开源模型封神:31B小体量硬刚千亿级对手,跑分碾压全场!

14. Google 今天发布了 Gemma 4,这是他们迄今最强的开源模型家族,脱胎于 Gemini 3 的同一套研究成果。最大的变化是许可证。之前的 Gemma 用的是 Google 自家的许可协议,限制不少。这次 Gemma 4 全系列换成了 Apache 2.0 开源协议,商用、修改、分发都没障碍。对企业和独立开发者来说,这意味着可以放心把模型嵌入自己的产品,不用再反复研究条款里的灰色地带。Gemma 4 提供四个尺寸:31B Dense、26B MoE(混合专家架构)、E4B 和 E2B。其中 31B 在 Arena AI 开源模型文本排行榜上排第三,26B 排第六,Google 称它们的表现超过了体量大 20 倍的模型。大模型支持 256K 上下文窗口,可以一次性喂入长文档或整个代码仓库。有意思的是端侧能力。E2B 和 E4B 两个小模型是 Google 和 Pixel 团队、高通、联发科联合开发的,能跑在手机、树莓派、Jetson Nano 上,延迟接近零。小模型还额外支持音频输入和语音理解。想在手机上跑一个能看图、听话、还能离线写代码的本地 AI 智能体,现在有了一个不错的开箱即用选项。31B 模型不做量化的情况下,可以装进单张 80GB 的 H100 显卡。全系列原生支持函数调用和结构化 JSON 输出,直接面向 AI Agent 开发场景。目前已经可以在 Google AI Studio、Hugging Face、Kaggle、Ollama 等平台获取模型权重。Gemma 系列自发布以来累计下载量已超过 4 亿次,社区创建了超过 10 万个变体。Google 显然想用开源生态绑住开发者。不过在 Arena AI 开源排行榜上,目前前列位置大量被中国开源模型占据,Gemma 4 的 31B 排第三,能守住多久是个问号。 宝玉xp的微博视频

15. #谷歌发布Gemma4开源大模型##谷歌发布Gemma4开源大模型#谷歌最近开源的Gemma 4系列,有几个地方确实挺实在。最让人眼前一亮的是,现在手机就能离线跑多模态AI了。比如你在没有信号的飞机上,也能用手机直接识别图片里的文字、做语音记录,不用联网也不用上传数据。而且普通电脑显卡就能带动大模型,不用非得买昂贵的专业设备。当然它也不是完美的,小模型在生成代码时偶尔会出错,稳定性还有提升空间。总的来说,谷歌这次把技术彻底开放商用,降低了AI的使用门槛。对我们普通用户来说,最大的好处就是:好用的AI工具不再需要昂贵的硬件,未来在手机、电脑上就能轻松跑起来了。“你平时会在手机上用AI工具吗?最希望AI帮你解决什么日常小问题?欢迎在评论区聊聊~”谷歌发布gemma4开源大模型

16. #李想称努比亚豆包手机是现象级AI产品# 不得不说,这几年AI领域为我的生活和工作带来了翻天覆地的变化,从最开始觉得没什么用,再到后来的不断尝鲜,现在我的日常已经完全离不开AI了。在过去的一年里,也诞生了不少有意思的AI产品,其中也不乏咱们中国的产品,豆包手机作为字节跳动与中兴努比亚合作推出的首款深度集成AI代理的工程样机,凭借“系统级跨应用操作”能力在2025年底给各家AI和手机厂商狠狠地上了一课。李想在他的朋友圈,也将努比亚豆包手机纳入了他的2025年全年最有突破性的三个现象级AI产品名单。相比于同样在榜的Chrome Gemini,豆包手机在手机端拥有更多的优势,手机端不光相较电脑端有很多的应用,也更加方便,豆包手机可以直接在订票软件完成机票酒店下单,对普通用户来说,学习成本更低,更容易上手。2026年才刚过了一个月,新的AI产品就已经呈现出了井喷现象,甚至出现了多款现象级产品,相信接下来,会有更多实用的AI产品或功能进入我们的生活。

17. 以小小小小胜大!Google 最强小模型刚刚发布,手机也能跑

18. 谷歌Gemma的四个秘密:从海豚语到掌上AI

19. #谷歌发布Gemma4开源大模型# 谷歌正式推出Gemma 4大模型,包括四种规格的Gemma 4通用模型:高效20亿参数版(E2B)、高效40亿参数版(E4B)、260亿混合专家模型(MoE)与310亿稠密模型(31B)。 在谷歌迄今为止所有的模型中,Gemma 4 是目前最强大的开放权重模型系列,继承了前沿多模态、长上下文和高级推理能力,被谷歌官方称之为是“在逐字节比较下性能最强的”开放模型(Byte for byte, the most capable open models),填补了本地前沿智能的空白,与追求极致性能的 Gemini 云端模型共同构成了完整生态。整体来说,Gemma 4这次所有规模的模型都原生支持处理视频和图像了,在OCR和图表理解方面表现得相当不错。

20. 高通MWC 2026抢先探展,6G+Wi-Fi 8+个人AI全拉满

21. #豆包手机#豆包手机发布,AI Agent才是未来?泛化通用能力,或许是未来终端AI真正服务消费者的支点。这依赖于端侧大模型对模糊需求的精准解读,以及操作系统对生态服务的无缝调用。在AI手机的赛道上,硬件厂商基于自身OS能力部署AI Agent,荣耀最早开启端侧AI研究和应用的手机厂商,在荣耀Magic8系列上,AI agent自动执行覆盖衣食住行3000+场景,支持通过YOYO语音交互实现操控。当AI开始自主串联“感知-决策-执行”的完整链条,未来的终端,是否会从“工具”演变为“生活流程的默认知情者”?

22. 一个周末 AI 项目

23. 谷歌发布 TurboQuant 技术攻克内存壁垒,千亿参数 AI 大模型可在普通手机本地运行

24. Qwen3.6-Plus

25. Meta MobileLLM-Pro

26. 谷歌再发端侧「小模型」,全球首个多模态长上下文编解码模型 T5Gemma 2

27. EmbeddingGemma

28. 以小小小小胜大!Google 最强小模型刚刚发布,手机也能跑

29. 谷歌新算法砍半 AI 内存开销,大模型直接省 6 倍显存

30. 把大模型“塞”进手机分几步?

31. 谷歌放大招!开源Function Gemma,能打造豆包同款AI手机啦!

32. 谷歌开源Gemma 4,干掉了13倍体量的Qwen3.5

33. 使用 Google 的 LangExtract 和 Gemma 进行结构化数据提取

34. 一万刀,12模型,砸出的结论:微调,Qwen3-4B最能打

35. 新一轮换机潮可期?!只因豆包手机端助手上线

36. 谷歌最强开放翻译模型TranslateGemma登场,手机也能跑

37. Meta推出MobileLLM-Pro 1B端侧小模型,干翻Google Gemma3和自家Llama3.2 1B

38. CES 2026看高通:从个人AI到物理AI 全场景智能正加速落地

39. 字节Ai硬件概念。【字节探索终端AI 布局超级 App与硬件终端结合】 2025年12月1日,字节旗下豆包官方发布豆包手机助手,豆包手机助手是豆包和手机厂商在操作系统层面合作的手机AI助手。字节在AI方面的布局是“三位一体”,即将大模型能力、超级 App 与硬件终端结合。目前终端智能手机最能满足字节跳动耗时多年构建的全栈 AI布局。 作者声明:本内容仅作为信息资讯参考,不构成任何具体的投资建议。理财有风险,投资需谨慎。纯手工梳理,研究不易,望您多多点赞! #字节Ai #豆包Ai #Ai手机 #Ai端侧 #Ai硬件

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章