Gemma 4与CosyVoice 3.0实现本地语音交互闭环,支持消费级硬件部署

源自69位全网作者

04-07 13:42

精选参考来源

1
谷歌又放大招了Gemma4发布后,谷歌一口气放出了四个版本:手机端 E2B/E4B 轻量版、26B MoE 极速版、31B 旗舰版。 尤其是31B 旗舰版,Arena AI 开源榜全球第三的位置相当惊人,小参数直接越级干翻体量20倍的对手,以前要机房集群才能跑的高端能力,现在消费级显卡就能本地跑通。不过,个人觉得31B版和国内顶流开源模型其实各有胜负,并非碾压全场 #ai前沿速递##微博兴趣创作计划##how i ai#
2
#Gemma 4:字节对字节,最强大的开源模型#发布日期:2026 年 4 月 2 日 作者:Clement Farabet(Google DeepMind 研究副总裁)、Olivier Lacombe(Google DeepMind 产品组经理)Google DeepMind 今日正式发布 Gemma 4,这是迄今为止最强大的开源模型家族。Gemma 4 以“字节对字节”(byte for byte)的方式定义了开源模型的新基准,专为高级推理(reasoning)和代理式工作流(agentic workflows)而构建。它在保持轻量级和高效率的同时,实现了前沿级别的智能表现,适用于从移动设备到服务器的各种部署场景。Gemma 4 系列模型在 Arena.ai 的聊天竞技场(chat arena)中展现出领先的开放模型性能-vs-大小表现(数据截至 2026 年 4 月 1 日)。这些模型经过大量不同数据集和指标的全面评估,涵盖文本生成的各个方面。更多详细基准测试请参阅官方模型卡。Gemma 4 以 Apache 2.0 许可发布是一个巨大的里程碑。我们非常兴奋能在首日就在 Hugging Face 上全面支持 Gemma 4 系列模型。 ——Clément Delangue,Hugging Face 联合创始人兼 CEO#Gemma 4 的核心亮点与架构创新#Gemma 4 是 Google DeepMind 构建的开源模型家族,采用多模态设计,支持文本和图像输入(小型模型还原生支持音频),并生成文本输出。本次发布包括预训练和指令微调(instruction-tuned)两种变体,上下文窗口最高可达 256K tokens,并支持超过 140 种语言的多语言能力。Gemma 4 同时提供 Dense(密集)和 Mixture-of-Experts(MoE,混合专家)两种架构,特别适合文本生成、编程和复杂推理任务。模型共有四种尺寸:E2B、E4B、26B A4B 和 31B,可灵活部署于高端手机、笔记本电脑乃至服务器环境,真正实现 AI 的普惠。#关键能力与架构升级#- 强大推理能力:全系列模型均设计为高性能推理器,支持可配置的“思考模式”(thinking mode)。 - 扩展多模态支持:处理文本、图像(支持可变宽高比和分辨率,所有模型均支持)、视频,以及音频(E2B 和 E4B 模型原生支持)。 - 多样化高效架构:提供 Dense 和 MoE 变体,不同尺寸可根据部署需求灵活选择。 - 设备端优化:小型模型专为笔记本和移动设备本地高效执行而设计。 - 超长上下文窗口:小型模型支持 128K tokens,中型模型支持 256K tokens。 - 增强编程与代理能力:编程基准显著提升,并原生支持函数调用(function-calling),可驱动高度自主的 AI 代理。 - 原生系统提示支持:引入系统角色(system role)支持,实现更结构化、可控的对话。Gemma 4 采用混合注意力机制(hybrid attention),在局部滑动窗口注意力(local sliding window attention)和全局注意力(full global attention)之间交替,确保最后一层始终为全局注意力。这种设计在保持轻量级模型的速度和低内存占用同时,保留了处理复杂长上下文任务所需的深度感知能力。为优化长上下文内存,全局层使用统一的 Key-Value,并应用比例 RoPE(Proportional RoPE,p-RoPE)。#模型概览#Gemma 4 针对从移动/边缘设备(E2B、E4B)到消费级 GPU 和工作站(26B A4B、31B)的部署场景,均提供前沿级性能,特别适用于推理、代理工作流、编程和多模态理解。#Dense 模型规格#属性 E2B E4B 31B Dense总参数量 2.3B 有效(含嵌入 5.1B) 4.5B 有效(含嵌入 8B) 30.7B层数 35 42 60滑动窗口 512 tokens 512 tokens 1024 tokens上下文长度 128K tokens 128K tokens 256K tokens词汇表大小 262K 262K 262K支持模态 文本、图像、音频 文本、图像、音频 文本、图像视觉编码器参数 \~150M \~150M \~550M音频编码器参数 \~300M \~300M 无音频说明:E2B 和 E4B 中的“E”代表“Effective”(有效)参数。小型模型采用 Per-Layer Embeddings(PLE,每层嵌入)技术,通过为每个解码器层提供独立的微型嵌入表实现参数高效利用。这些嵌入表虽大,但仅用于快速查找,因此有效参数量远小于总参数量,特别适合设备端部署。#Mixture-of-Experts(MoE)模型规格#属性 26B A4B MoE总参数量 25.2B激活参数量 3.8B层数 30滑动窗口 1024 tokens上下文长度 256K tokens词汇表大小 262K专家数量 8 激活 / 128 总 + 1 共享支持模态 文本、图像视觉编码器参数 \~550M说明:26B A4B 中的“A”代表“Active”(激活)参数。在推理时仅激活约 4B 参数子集,使 MoE 模型的运行速度远高于其 26B 总参数暗示的速度,几乎相当于 4B 参数模型的速度,适合追求快速推理的场景。#基准测试结果#Gemma 4 在多个权威基准上展现出卓越性能(以下为指令微调模型结果,与前代 Gemma 3 27B 对比):基准测试 Gemma 4 31B Gemma 4 26B A4B Gemma 4 E4B Gemma 4 E2B Gemma 3 27B(无思考模式)MMLU Pro 85.2% 82.6% 69.4% 60.0% 67.6%AIME 2026(无工具) 89.2% 88.3% 42.5% 37.5% 20.8%LiveCodeBench v6 80.0% 77.1% 52.0% 44.0% 29.1%Codeforces ELO 2150 1718 940 633 110GPQA Diamond 84.3% 82.3% 58.6% 43.4% 42.4%Tau2(3 次平均) 76.9% 68.2% 42.2% 24.5% 16.2%HLE(无工具) 19.5% 8.7% - - -HLE(带搜索) 26.5% 17.2% - - -BigBench Extra Hard 74.4% 64.8% 33.1% 21.9% 19.3%MMMLU 88.4% 86.3% - - -(完整基准详见官方模型卡。Gemma 4 在编程、数学推理、通用知识等多个维度全面领先,尤其在长上下文和多模态任务上表现出色。)#使用指南与最佳实践##1. 采样参数(Sampling Parameters)#根据任务需求调整温度(temperature)、top-p 等参数,以平衡创造性和确定性。#2. 思考模式配置(Thinking Mode Configuration)#Gemma 4 支持显式思考模式,可显著提升复杂推理任务的表现。#3. 多轮对话(Multi-Turn Conversations)#利用长上下文窗口,支持更自然的持续对话。#4. 模态顺序(Modality Order)#图像/音频输入顺序会影响模型理解,建议按逻辑顺序提供。#5. 可变图像分辨率(Variable Image Resolution)#所有模型均支持动态分辨率,优化视觉理解效率。#6. 音频处理(Audio)#E2B/E4B 模型原生支持音频输入,适用于语音相关任务。#7. 音频与视频长度(Audio and Video Length)#建议控制输入长度以保持最佳性能和效率。#获取与部署#Gemma 4 采用 Apache 2.0 许可,完全开放商用。开发者可立即通过以下渠道获取:- Hugging Face:网页链接(首日完整支持) - GitHub:网页链接 - 官方文档:网页链接 - Google AI Studio / Vertex AI:快速原型开发与生产部署 - Google Cloud:已原生集成,支持大规模应用Gemma 4 还获得 vLLM、Google TPU、AMD GPU、Intel XPU 等主流推理引擎的首日支持,极大降低了部署门槛。#结语:开源 AI 的新纪元#Gemma 4 不仅是 Google DeepMind 开放模型战略的最新里程碑,更是整个开源 AI 生态的一次重大跃升。它证明了“智能 per 参数”的极致优化可以在不牺牲性能的前提下实现真正的普惠——从手机到云端,从个人开发者到企业团队,都能轻松触达前沿多模态推理能力。无论你是构建智能代理、开发代码助手、还是探索多模态应用,Gemma 4 都将为你提供强大、可靠且完全开放的基石。立即前往 Hugging Face 或官方文档,开始你的 Gemma 4 之旅吧!更多资源: - 官方模型卡:网页链接 - 发布博客: 网页链接/ - 许可协议:网页链接本文基于 Google 官方博客及 Gemma 4 模型卡完整内容翻译与整理,确保信息零损耗、无遗漏。所有技术细节、表格与基准数据均忠实还原自官方来源。 Google谷歌爱好者的微博视频
全部
来源
内容由AI生成

精选参考来源

1. 谷歌又放大招了Gemma4发布后,谷歌一口气放出了四个版本:手机端 E2B/E4B 轻量版、26B MoE 极速版、31B 旗舰版。 尤其是31B 旗舰版,Arena AI 开源榜全球第三的位置相当惊人,小参数直接越级干翻体量20倍的对手,以前要机房集群才能跑的高端能力,现在消费级显卡就能本地跑通。不过,个人觉得31B版和国内顶流开源模型其实各有胜负,并非碾压全场 #ai前沿速递##微博兴趣创作计划##how i ai#

2. #Gemma 4:字节对字节,最强大的开源模型#发布日期:2026 年 4 月 2 日 作者:Clement Farabet(Google DeepMind 研究副总裁)、Olivier Lacombe(Google DeepMind 产品组经理)Google DeepMind 今日正式发布 Gemma 4,这是迄今为止最强大的开源模型家族。Gemma 4 以“字节对字节”(byte for byte)的方式定义了开源模型的新基准,专为高级推理(reasoning)和代理式工作流(agentic workflows)而构建。它在保持轻量级和高效率的同时,实现了前沿级别的智能表现,适用于从移动设备到服务器的各种部署场景。Gemma 4 系列模型在 Arena.ai 的聊天竞技场(chat arena)中展现出领先的开放模型性能-vs-大小表现(数据截至 2026 年 4 月 1 日)。这些模型经过大量不同数据集和指标的全面评估,涵盖文本生成的各个方面。更多详细基准测试请参阅官方模型卡。Gemma 4 以 Apache 2.0 许可发布是一个巨大的里程碑。我们非常兴奋能在首日就在 Hugging Face 上全面支持 Gemma 4 系列模型。 ——Clément Delangue,Hugging Face 联合创始人兼 CEO#Gemma 4 的核心亮点与架构创新#Gemma 4 是 Google DeepMind 构建的开源模型家族,采用多模态设计,支持文本和图像输入(小型模型还原生支持音频),并生成文本输出。本次发布包括预训练和指令微调(instruction-tuned)两种变体,上下文窗口最高可达 256K tokens,并支持超过 140 种语言的多语言能力。Gemma 4 同时提供 Dense(密集)和 Mixture-of-Experts(MoE,混合专家)两种架构,特别适合文本生成、编程和复杂推理任务。模型共有四种尺寸:E2B、E4B、26B A4B 和 31B,可灵活部署于高端手机、笔记本电脑乃至服务器环境,真正实现 AI 的普惠。#关键能力与架构升级#- 强大推理能力:全系列模型均设计为高性能推理器,支持可配置的“思考模式”(thinking mode)。 - 扩展多模态支持:处理文本、图像(支持可变宽高比和分辨率,所有模型均支持)、视频,以及音频(E2B 和 E4B 模型原生支持)。 - 多样化高效架构:提供 Dense 和 MoE 变体,不同尺寸可根据部署需求灵活选择。 - 设备端优化:小型模型专为笔记本和移动设备本地高效执行而设计。 - 超长上下文窗口:小型模型支持 128K tokens,中型模型支持 256K tokens。 - 增强编程与代理能力:编程基准显著提升,并原生支持函数调用(function-calling),可驱动高度自主的 AI 代理。 - 原生系统提示支持:引入系统角色(system role)支持,实现更结构化、可控的对话。Gemma 4 采用混合注意力机制(hybrid attention),在局部滑动窗口注意力(local sliding window attention)和全局注意力(full global attention)之间交替,确保最后一层始终为全局注意力。这种设计在保持轻量级模型的速度和低内存占用同时,保留了处理复杂长上下文任务所需的深度感知能力。为优化长上下文内存,全局层使用统一的 Key-Value,并应用比例 RoPE(Proportional RoPE,p-RoPE)。#模型概览#Gemma 4 针对从移动/边缘设备(E2B、E4B)到消费级 GPU 和工作站(26B A4B、31B)的部署场景,均提供前沿级性能,特别适用于推理、代理工作流、编程和多模态理解。#Dense 模型规格#属性 E2B E4B 31B Dense总参数量 2.3B 有效(含嵌入 5.1B) 4.5B 有效(含嵌入 8B) 30.7B层数 35 42 60滑动窗口 512 tokens 512 tokens 1024 tokens上下文长度 128K tokens 128K tokens 256K tokens词汇表大小 262K 262K 262K支持模态 文本、图像、音频 文本、图像、音频 文本、图像视觉编码器参数 \~150M \~150M \~550M音频编码器参数 \~300M \~300M 无音频说明:E2B 和 E4B 中的“E”代表“Effective”(有效)参数。小型模型采用 Per-Layer Embeddings(PLE,每层嵌入)技术,通过为每个解码器层提供独立的微型嵌入表实现参数高效利用。这些嵌入表虽大,但仅用于快速查找,因此有效参数量远小于总参数量,特别适合设备端部署。#Mixture-of-Experts(MoE)模型规格#属性 26B A4B MoE总参数量 25.2B激活参数量 3.8B层数 30滑动窗口 1024 tokens上下文长度 256K tokens词汇表大小 262K专家数量 8 激活 / 128 总 + 1 共享支持模态 文本、图像视觉编码器参数 \~550M说明:26B A4B 中的“A”代表“Active”(激活)参数。在推理时仅激活约 4B 参数子集,使 MoE 模型的运行速度远高于其 26B 总参数暗示的速度,几乎相当于 4B 参数模型的速度,适合追求快速推理的场景。#基准测试结果#Gemma 4 在多个权威基准上展现出卓越性能(以下为指令微调模型结果,与前代 Gemma 3 27B 对比):基准测试 Gemma 4 31B Gemma 4 26B A4B Gemma 4 E4B Gemma 4 E2B Gemma 3 27B(无思考模式)MMLU Pro 85.2% 82.6% 69.4% 60.0% 67.6%AIME 2026(无工具) 89.2% 88.3% 42.5% 37.5% 20.8%LiveCodeBench v6 80.0% 77.1% 52.0% 44.0% 29.1%Codeforces ELO 2150 1718 940 633 110GPQA Diamond 84.3% 82.3% 58.6% 43.4% 42.4%Tau2(3 次平均) 76.9% 68.2% 42.2% 24.5% 16.2%HLE(无工具) 19.5% 8.7% - - -HLE(带搜索) 26.5% 17.2% - - -BigBench Extra Hard 74.4% 64.8% 33.1% 21.9% 19.3%MMMLU 88.4% 86.3% - - -(完整基准详见官方模型卡。Gemma 4 在编程、数学推理、通用知识等多个维度全面领先,尤其在长上下文和多模态任务上表现出色。)#使用指南与最佳实践##1. 采样参数(Sampling Parameters)#根据任务需求调整温度(temperature)、top-p 等参数,以平衡创造性和确定性。#2. 思考模式配置(Thinking Mode Configuration)#Gemma 4 支持显式思考模式,可显著提升复杂推理任务的表现。#3. 多轮对话(Multi-Turn Conversations)#利用长上下文窗口,支持更自然的持续对话。#4. 模态顺序(Modality Order)#图像/音频输入顺序会影响模型理解,建议按逻辑顺序提供。#5. 可变图像分辨率(Variable Image Resolution)#所有模型均支持动态分辨率,优化视觉理解效率。#6. 音频处理(Audio)#E2B/E4B 模型原生支持音频输入,适用于语音相关任务。#7. 音频与视频长度(Audio and Video Length)#建议控制输入长度以保持最佳性能和效率。#获取与部署#Gemma 4 采用 Apache 2.0 许可,完全开放商用。开发者可立即通过以下渠道获取:- Hugging Face:网页链接(首日完整支持) - GitHub:网页链接 - 官方文档:网页链接 - Google AI Studio / Vertex AI:快速原型开发与生产部署 - Google Cloud:已原生集成,支持大规模应用Gemma 4 还获得 vLLM、Google TPU、AMD GPU、Intel XPU 等主流推理引擎的首日支持,极大降低了部署门槛。#结语:开源 AI 的新纪元#Gemma 4 不仅是 Google DeepMind 开放模型战略的最新里程碑,更是整个开源 AI 生态的一次重大跃升。它证明了“智能 per 参数”的极致优化可以在不牺牲性能的前提下实现真正的普惠——从手机到云端,从个人开发者到企业团队,都能轻松触达前沿多模态推理能力。无论你是构建智能代理、开发代码助手、还是探索多模态应用,Gemma 4 都将为你提供强大、可靠且完全开放的基石。立即前往 Hugging Face 或官方文档,开始你的 Gemma 4 之旅吧!更多资源: - 官方模型卡:网页链接 - 发布博客: 网页链接/ - 许可协议:网页链接本文基于 Google 官方博客及 Gemma 4 模型卡完整内容翻译与整理,确保信息零损耗、无遗漏。所有技术细节、表格与基准数据均忠实还原自官方来源。 Google谷歌爱好者的微博视频

3. Google 今天发布了 Gemma 4,这是他们迄今最强的开源模型家族,脱胎于 Gemini 3 的同一套研究成果。最大的变化是许可证。之前的 Gemma 用的是 Google 自家的许可协议,限制不少。这次 Gemma 4 全系列换成了 Apache 2.0 开源协议,商用、修改、分发都没障碍。对企业和独立开发者来说,这意味着可以放心把模型嵌入自己的产品,不用再反复研究条款里的灰色地带。Gemma 4 提供四个尺寸:31B Dense、26B MoE(混合专家架构)、E4B 和 E2B。其中 31B 在 Arena AI 开源模型文本排行榜上排第三,26B 排第六,Google 称它们的表现超过了体量大 20 倍的模型。大模型支持 256K 上下文窗口,可以一次性喂入长文档或整个代码仓库。有意思的是端侧能力。E2B 和 E4B 两个小模型是 Google 和 Pixel 团队、高通、联发科联合开发的,能跑在手机、树莓派、Jetson Nano 上,延迟接近零。小模型还额外支持音频输入和语音理解。想在手机上跑一个能看图、听话、还能离线写代码的本地 AI 智能体,现在有了一个不错的开箱即用选项。31B 模型不做量化的情况下,可以装进单张 80GB 的 H100 显卡。全系列原生支持函数调用和结构化 JSON 输出,直接面向 AI Agent 开发场景。目前已经可以在 Google AI Studio、Hugging Face、Kaggle、Ollama 等平台获取模型权重。Gemma 系列自发布以来累计下载量已超过 4 亿次,社区创建了超过 10 万个变体。Google 显然想用开源生态绑住开发者。不过在 Arena AI 开源排行榜上,目前前列位置大量被中国开源模型占据,Gemma 4 的 31B 排第三,能守住多久是个问号。 宝玉xp的微博视频

4. 谷歌Gemma 4深夜突降,31B爆杀20倍巨头!手机跑全血「龙虾」

5. # 谷歌 DeepMind Gemma 4 重磅发布:Agent Skills 让手机彻底成为本地 AI 代理运行时 # 2026 年 4 月 2 日,Google DeepMind 开发者体验负责人 Omar Sanseviero(@osanseviero)在 X 平台发布重磅消息: As part of the Gemma 4 release, we're launching Agent Skills: an Android app experience where you can import different skills and have Gemma 4 E2B reason and use the skills! Running entirely in the phone, available in the Google PlayStore. Try it now! 随后补充下载链接与官方博客地址。本帖附带 116 秒演示视频,迅速引发全球开发者与 AI 爱好者热议,浏览量已超 16 万次。 同日,Google Developers Blog 发布官方文章《Bring state-of-the-art agentic skills to the edge with Gemma 4》,详细阐述 Gemma 4 模型家族及 Agent Skills 功能。本文基于 X 原始帖文(含完整视频演示)与官方博客全文内容无损完整呈现,深度拆解技术细节、演示案例、实现原理、开发者生态及行业意义,为中文读者提供一篇零信息损失、系统性的技术战略分析。 # 一、Gemma 4 模型家族:开源 Agentic AI 的新基准 # Google DeepMind 于 2026 年 4 月 2 日正式推出 Gemma 4 模型家族,以 Apache 2.0 许可开源。Gemma 4 专为边缘设备与移动场景优化,重新定义了本地硬件上的 AI 能力。 核心亮点(直接来自官方博客): 1. 多步规划与自主行动:无需专门微调,即可实现复杂任务链与自主代理。 2. 离线代码生成与音视频处理:支持 140+ 语言,面向全球开发者。 3. 视觉处理与多模态能力:支持图像、视频处理。 4. Gemma 4 E2B / E4B 变体:专为 Agent Skills 设计,E2B 模型在部分设备上峰值内存占用低于 1.5GB。 开发者可通过 Android AICore Developer Preview 或 Google AI Edge 工具链,在移动、桌面、边缘设备上快速构建代理式(Agentic)应用。 # 二、Agent Skills 核心机制:Google AI Edge Gallery 中的本地代理运行时 # Google AI Edge Gallery 应用已在 Android(Google Play Store)和 iOS(App Store)上线,支持完全本地运行的 AI 体验。今天正式推出 Agent Skills,这是首批在设备上实现多步、自主代理工作流的应用程序,由 Gemma 4 驱动。 Agent Skills 四大核心能力(官方博客原文): 1. 知识库增强(Augment the knowledge base):Gemma 4 可通过技能接入训练数据之外的信息。例如,构建 Wikipedia 技能,让代理回答任何百科问题。 2. 生成丰富交互内容(Produce rich, interactive content):将段落、视频转为摘要、闪卡,或将数据转为交互图表/图形。例如,基于用户语音输入的睡眠日志,技能自动生成每日睡眠与情绪趋势图表。 3. 扩展核心能力(Expand Gemma 4's core capabilities):集成其他模型,如文本转语音、图像生成、音乐合成。例如,上传照片后,技能分析氛围并自动匹配播放完美契合心情的音乐。 4. 端到端复杂工作流(Create comprehensive end-to-end experiences):用户通过与 Gemma 4 的自然语言对话完成多步任务,无需切换多个 App。例如,构建描述动物并播放叫声的完整应用。 技能开发与格式:每个技能本质上是 SKILL.md 文件(含提示词)+ 可选 JS 脚本(运行于隐藏 WebView)。JS 脚本拥有完整 fetch() API,可调用外部服务;原生 Intent 处理邮件、SMS;API Key 通过系统原生对话框输入,永不进入 LLM Prompt,保障隐私与安全。 技能支持 URL 导入、GitHub Discussions 社区分享,或本地 ADB 推送。Google AI Edge Gallery GitHub 仓库(http://t.cn/A6eG1Bp2)提供 /skills 目录模板,开发者可快速创建并在 Discussions 分类下分享技能。 # 三、LiteRT-LM 运行时:极致性能与跨平台支持 # 为让 Gemma 4 在各类设备上高效运行,Google 推出 LiteRT-LM —— 在 LiteRT 基础上新增 GenAI 专用库,集成 XNNPack 与 ML Drift。 关键特性(官方实测数据): - 极致内存优化:Gemma 4 E2B 在部分设备上内存占用 <1.5GB(2-bit / 4-bit 量化 + 内存映射逐层嵌入)。 - 约束解码:确保结构化、可预测输出,适用于生产级工具调用。 - 动态上下文:支持最高 128K 上下文长度,CPU/GPU 动态切换。 - 高性能处理:处理 4000 个输入 token(跨 2 个不同技能)耗时不到 3 秒。 - 边缘设备表现:Raspberry Pi 5 上预填充吞吐量 133 tokens/s,解码 7.6 tokens/s,可用于离线智能家居、语音助手、机器人。 跨平台支持: - 移动端:Android 12+ 与 iOS 17+,CPU/GPU 加速;Android 还可通过 AICore 系统级调用优化后的 Gemma 4。 - 桌面/Web:Windows、Linux、macOS(Metal)、WebGPU。 - IoT/机器人:Raspberry Pi 5、Qualcomm IQ8 NPU。 - 新工具:litert-lm Python 包 + CLI,支持无代码实验、工具调用,适用于 Linux、macOS、Raspberry Pi。 # 四、视频演示与实际体验(116 秒官方演示完整对应) # X 帖附带视频及 Google AI Edge Gallery 应用演示,直观展示 Agent Skills 流畅性: - 技能管理界面:一键导入、开启/关闭、搜索技能。 - Gemma-4-E2B-it 模型(GPU 加速)实时推理与技能调用。 - 演示案例涵盖 Wikipedia 查询、图表生成、照片配乐、动物介绍与叫声播放等,与博客四大能力完全对应。 整个过程100% 本地运行、无需联网、无数据泄露,充分验证“手机即完整 Agent 运行时”的理念。 # 五、开发者生态与开源贡献 # - 技能开发指南:GitHub 仓库提供完整模板与示例。 - 社区分享:通过 GitHub Discussions 提交技能,官方鼓励开发者构建并分享。 - 开源地址:Google AI Edge Gallery 已完全开源(Apache 2.0),支持模型管理、基准测试、Thinking Mode 等功能。 - 贡献与反馈:X 社区已有开发者分享自定义技能、Pixel 设备适配、Mac Mini 加载方案,同时指出部分设备(如 Pixel 10 Pro Fold)偶发兼容性问题,Google 通过 GitHub 快速迭代。 X 回复亮点(部分): - “skills as the app model for on-device AI agents. this is where the unbundling starts.” - “This is basically the Gemini Nano 4 developer preview.” - iOS 用户已可通过 App Store 下载体验。 # 六、战略意义:隐私、安全、普惠与产业重塑 # 1. 隐私革命:所有推理本地完成,敏感数据永不离开设备,特别适合科研、医疗、企业场景。 2. 离线可用性:打破云端依赖,真正实现“随时随地”代理工作流。 3. 开发者普惠:2B\~4B 小模型即可完成复杂任务,Play Store / App Store 一键安装即可体验 SOTA 代理能力。 4. 产业冲击:传统 App 可能被“技能超市”替代;手机从“查询机”升级为“执行机”;边缘 AI 与 Agentic AI 融合,将加速机器人、智能硬件、个人助理爆发。 5. 与云端互补:本地 Gemma 4 可作为 Gemini Nano 4 的开发者预览,未来无缝迁移。 # 七、立即体验与深入阅读 # - Android:Google Play Store 搜索 “Google AI Edge Gallery” 或直接访问 http://t.cn/AXIRZXRS - iOS:App Store 搜索 “Google AI Edge Gallery” 或直接访问 http://t.cn/AXIRZXRK - 开发者:GitHub http://t.cn/A6eG1Bp2 下载源码、构建自定义技能 - 官方博客:http://t.cn/AXIRZXR9 # 总结 # Gemma 4 + Agent Skills 并非简单模型更新,而是移动 AI 的一次范式跃迁。它把“代理”从云端拉到掌心,把“技能”变成可组合的乐高积木,让每一位用户与开发者都能在本地构建属于自己的智能未来。这不仅仅是 Google 的技术里程碑,更是整个边缘智能时代正式开启的信号。 (本文基于 X 原始帖文全文、116 秒官方视频描述及 Google Developers Blog 完整内容撰写) http://t.cn/AXIRZa7v

6. 谷歌Gemma 4开源模型封神:31B小体量硬刚千亿级对手,跑分碾压全场!

7. 如何评价 Google 发布的开源大模型 Gemma4?使用体验怎么样?

8. iPhone本地跑Gemma 4火了,0 token时代还有多远?

9. #谷歌发布Gemma4开源大模型##谷歌发布Gemma4开源大模型#谷歌最近开源的Gemma 4系列,有几个地方确实挺实在。最让人眼前一亮的是,现在手机就能离线跑多模态AI了。比如你在没有信号的飞机上,也能用手机直接识别图片里的文字、做语音记录,不用联网也不用上传数据。而且普通电脑显卡就能带动大模型,不用非得买昂贵的专业设备。当然它也不是完美的,小模型在生成代码时偶尔会出错,稳定性还有提升空间。总的来说,谷歌这次把技术彻底开放商用,降低了AI的使用门槛。对我们普通用户来说,最大的好处就是:好用的AI工具不再需要昂贵的硬件,未来在手机、电脑上就能轻松跑起来了。“你平时会在手机上用AI工具吗?最希望AI帮你解决什么日常小问题?欢迎在评论区聊聊~”谷歌发布gemma4开源大模型

10. Gemma4对高通是巨大利好 谷歌新出的Gemma4大模型,就是给高通量身定做的“赚钱神器”,对高通来说,完完全全是天上掉馅饼的大好事。 以前的AI大模型又大又笨,只能在服务器上跑,手机根本带不动。而Gemma4是轻量化小模型,专门能在手机、汽车这些终端设备上离线运行,不用靠网络,反应还快,这刚好戳中了高通的核心优势。 高通靠骁龙芯片吃饭,芯片里的NPU就是专门跑AI的,Gemma4一出来,刚好能把高通芯片的AI能力彻底发挥出来。以后安卓手机、平板、智能汽车,想装本地AI、用离线智能功能,就必须靠高通的芯片,别家芯片优化跟不上,根本跑不动Gemma4。 这就意味着,高通的芯片会变得更值钱,手机厂商、车企抢着买,不光销量能涨,芯片还能卖更高的价格,利润直接往上翻。而且Gemma4是开源的,无数开发者会围着它做应用,用的人越多,高通芯片的地位就越稳,直接甩开竞争对手,在安卓AI芯片领域一家独大。 更关键的是,不光手机,智能汽车、智能家居这些领域,Gemma4都能适配,高通的芯片能顺着这个风口,打进更多市场,赚更多钱。 说白了,Gemma4就是给高通送了一把打开AI市场的金钥匙,以后不管是业绩还是行业地位,都能往上冲一大截,说是巨大利好一点不夸张。#谷歌发布gemma4开源大模型#

11. 【#谷歌发布FunctionGemma#:把 AI 大模型能力“压缩”进手机,以后玩游戏全靠“吼”】谷歌于 12 月 18 日发布公告,宣布推出 FunctionGemma,是基于 Gemma 3 270M 微调的专用模型,目的是将强大的函数调用(Function Calling)能力引入手机等边缘设备。谷歌表示,随着行业从单纯的对话式接口转向主动式智能体(Agent),开发者对模型本地执行任务的需求日益迫切。FunctionGemma 正是为此而生,它不仅继承了 Gemma 系列的轻量化优势,更通过专项微调,让边缘设备(如智能手机和嵌入式系统)无需依赖云端算力,能够精准理解用户指令并调用相应功能。与通用大模型不同,FunctionGemma 专为“定制化”设计。它既能与人类自然对话,也能生成结构化的函数调用代码来指挥计算机。在 Google 进行的“移动操作”(Mobile Actions)测试中,该模型展现了惊人的可塑性:未经微调的基础版本准确率为 58%,而经过针对性微调后,其执行复杂指令(如“明天约午饭并添加到日历”、“帮我把昨天拍的美食发给老妈”)的准确率跃升至 85%。为了在算力和电池受限的边缘设备上流畅运行,FunctionGemma 采用了极致的轻量化设计。它利用 Gemma 的 256k 词表高效处理 JSON 数据和多语言输入,大幅降低了延迟。该模型目前已适配 NVIDIA Jetson Nano 等开发板及主流移动设备,甚至能作为“交通指挥官”,处理简单任务并将复杂逻辑路由至更大的 Gemma 3 27B 模型。为了降低开发门槛,谷歌为 FunctionGemma 构建了广泛的生态支持。开发者现在即可通过 Hugging Face、Kaggle 下载模型,并利用 Unsloth、Keras 或 NVIDIA NeMo 进行微调。在部署方面,该模型全面支持 LiteRT-LM、vLLM、Llama.cpp 和 Ollama 等工具。谷歌还同步发布了 TinyGarden 游戏演示和“移动操作”微调指南,展示了如何用自然语言控制虚拟农场或手机系统设置,帮助开发者快速构建属于自己的私有化、低延迟端侧智能体。(IT之家) 梨视频的微博视频

12. Gemma 4 来了,Google DeepMind 开源多模态的最强模型,吊打Qwen3.5 27B?

13. 阿里开源CosyVoice 3.0,支持双向流式、超多语言、情感控制、后训练、合成质量超自然~

14. CosyVoice 论文笔记

15. 首次提出监督语义token!CosyVoice多语言TTS:零样本克隆SS达81.58%,中英合成质量追平人类

16. ollama v0.20.0 更新:Gemma 4 全家桶发布,音频、视觉、MoE、BPE 支

17. Gemma 4 谷歌开源的字节效率之王,全面支持文本、图像、视频和音频

18. CosyVoice 3.0 把“零样本多语种配音”做成了开源全家桶:从 150ms 双流式到一键部署

19. Gemma 4 模型详解:E4B 与 31B 版本的智力水平对比、硬件条件及部署建议

20. 阿里通义实验室开源Fun-CosyVoice3-0.5B:支持零样本声音克隆

21. Gemma 4 深度解析:谷歌最新的开放模型能做什么?

22. Byte for Byte,谷歌开源最强模型Gemma 4 杀入手机端

23. 谷歌这次真的把家底掏光了!Gemma 4 炸场开源圈,31B 越级斩杀千亿模型

24. 阿里开源CosyVoice 3:0.5B参数的语音合成新标杆

25. Google Gemma 4 开源模型适配 RTX 显卡,本地运行智能体 AI 成真

26. 炸场!Gemma 4 开源发布:31B 硬刚千亿巨头,手机离线满血跑,开源 AI 彻底进入新纪元

27. 3秒复刻灵笼!CosyVoice三部曲深度解析【论文精读】 - 哔哩哔哩

28. Gemma 4本地部署小白教程,对比 Qwen3:Gemma 4 避坑指南。

29. 谷歌推出最强手机端开源模型Gemma4 E2B/E4B

30. 延迟低到离谱!这个阿里开源项目让AI真的能和你“谈心”

31. CosyVoice2-0.5B:全栈语音生成的革命性突破,实现超低延迟多语言合成

32. 4月2日-谷歌 Gemma 4 深夜突袭!31B 模型击败大 20 倍对手,教你用 Ollama 本地部署并接入 OpenClaw

33. CosyVoice 3: Towards In-the-wild Speech Generationvia Scaling-up and Post-training 论文解读

34. Fun-CosyVoice 3 重磅升级|更快、更准、更强 Fun-CosyVoice 3 在首包延迟、合成内容准确率、多语言与情感表达等能力上全面提升,并同步开源 0.5B 轻量模型。 ⭐️核心升级亮点 • 首包延迟下降 50%,支持双向流式合成,实现输入即发声 • 中英混说能力显著提升,WER 下降 56.4% • 内容一致性与音色相似度全面提升,复杂场景CER相对降低26% • 支持 9 种语言、18 种方言、9 种情感,支持跨语种音色复刻 ⭐️Fun-CosyVoice 3(0.5B) 模型开源 • 支持零样本音色克隆 • 本地部署友好 • 多项评测优于主流开源 TTS 模型 #通义 #语音大模型 #语音生成 #涨知识 #科技

35. Google 开源 Gemma 4:最强开源模型?来了

36. Google DeepMind 正式推出 Gemma 4

37. Google真正开源模型Gemma 4,31B只要20GB显存,性能稍落后GLM-5

38. Google Gemma 4 开源|全面解读

39. CosyVoice3:通过扩展规模和后训练实现In-the-wild 语音生成

40. Google Gemma 4 正式发布:开源 AI 模型的里程碑之作

41. 谷歌发布 Gemma 4 开源大模型,31B 参数性能达头部水准

42. 谷歌AI的安卓:最新开放模型 Gemma 4,抢滩 On-device AI

43. CosyVoice3 - 跨语言会方言、懂情绪的智能配音工具 一键整合包下载

44. 谷歌发布 Gemma-4:手机本地就能跑的开源大模型,还支持 Agent 和多模态

45. 谷歌开源Gemma 4,干掉了13倍体量的Qwen3.5

46. 【中配】Gemma 4 新特性介绍 - Google for Developers

47. 谷歌Gemma 4 发布:端侧小模型也能跑全模态了

48. 谷歌开源Gemma 4,31B越级斩杀20倍体量巨头

49. [中配]Gemma 4:我在笔记本和台式机上的实测体验 - Zero to MVP

50. 流式TTS新天花板!CosyVoice 2统一流/非流TTS:WER 2.47%超人类,100%码本利用率碾压VQ

51. 🦞在OpenClaw实测谷歌开源大模型Gemma 4!256K上下文+多模态输入,龙虾里实战测试多Agent协作与浏览器自动化全流程!31B参数碾压同参数竞品

52. Google Gemma 4发布,手机到工作站全覆盖,开源商用全面放开

53. 谷歌重磅开源Gemma 4!手机离线跑 Agent、还降内存,Qwen被拉进正面对决

54. 无需云服务器!Gemma 4+Ollama本地部署,免费解锁 multimodal

55. 重磅!Apache 2.0完全开源!Gemma 4本地部署教程,手机也能跑!

56. 文字转语音声音克隆神器软件CosyVoice 3.0一键启动整合包,高质量情感语音合成工具 - 哔哩哔哩

57. 比国产AI还卷:谷歌Gemma 4以小博大,端侧模型迎来分水岭

58. GLM-4-Voice:迈向智能且类人端的端到端语音聊天机器人

59. 小参数越级对标!Google Gemma 4性能炸裂,多模态+长上下文,Mac一键本地运行

60. CosyVoice3-0.5b最新版整合包,修复生成电音问题,支持18种方言和9国语言,情绪控制更稳定,断句效果更好

61. 谷歌正式发布 Gemma 4 :最强开源本地大模型,支持多模态+离线运行

62. Google 放了个大招:Gemma 4 开源了,还换成了 Apache 2.0 许可证

63. 玩转Gemma 4:本地部署落地,零成本高效推理

64. 谷歌又出开源模型,这次的模型怎么样?

65. Google Gemma 4 完全指南:技术规格与手机端部署教程

66. Gemma 4开源!整整一年,谷歌终于想明白了!!!

67. 零成本养虾!谷歌 Gemma 4「本地部署」保姆级教程,三步搞定

68. Gemma4大模型开源!Google针对工作流优化,已是消费级本地部署最优选择

69. Gemma 4来了 普通人离真正好用的本地AI又近了一步

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章