欢迎回来
登录你的知识库账户
忘记密码?
还没有账户?立即注册
创建账户
注册你的专属知识库
已有账户?去登录
找回密码
输入注册邮箱获取验证码
返回登录
请输入图片中的验证码以继续注册
加载中...
取消
新建收藏
手动添加你喜欢的内容
取消
编辑头像与昵称
上传新头像或修改你的显示昵称
支持 JPG/PNG,最大 2MB
取消

问题反馈

notebasewww.notebase.cn
控制台
内容库
动态
管理
账户
U
用户
--
在线
v0.8.7 · 知识库
笔记
KnowledgeBase
网络无边,知识有迹。
0笔记
0工具
30推荐

分类导航

按主题直达

编辑精选

站内用户贡献 · 真实笔记

最新收录

每日更新
继续浏览全部内容 →
>
笔记
0
加载中...
工具
0
此页用于记录用户反馈问题后的每一次改进
笔记用法

“写笔记”支持四种格式——Word 文档、Excel 表格、Markdown、纯文本,起稿或二次编辑时都能随时切换,同一篇笔记想用哪种形态来记,都由你说了算。

md、txt、csv、json 这类纯文本则原样载入,不做多余加工。拿一张现成的表倒进来、改几笔、再导出去,等于白用一台免费的格式转换器。

要带走就在右上角点“下载”,可导出 PDF、Word、Markdown、Excel、TXT 等格式;列表卡片“⋯”菜单里,也有同样的下载入口。

工具用法

在“工具”页点“+ 上传工具”即可发布:填好名称与链接,再用 Markdown 把使用方法写清楚——能解决什么问题、怎么装、怎么用,比堆介绍实在。

要分发安装包就一并上传压缩包(ZIP、RAR、7Z、TAR.GZ,最大 35MB),别人在详情页一键下载;只放链接不带附件也可以。

工具按大家的收藏热度排序,好用的自然会被顶上来。发布后可在详情页或卡片菜单里编辑、下架。

隐藏笔记

写笔记时勾上“隐藏”,这篇就只存在于你自己的账号里:不进列表、不进搜索、不上首页精选,也不会出现在任何公开的页面,链接发给别人同样打不开。

适合放密码、草稿、日记这类只给自己看的内容;想公开,去“发布”打开它,把“隐藏”的勾去掉再保存,之后编辑会默认保持原状态,不会悄悄变回公开。

数据安全

你的内容会同时保存在多个副本上,系统定期做备份与完整性校验,再配合异地容灾机制:就算某台机器出问题,数据也不会丢,可以长期放心存放;特别重要的资料,仍建议你另外再留一份备份。

技术

全站跑在容器化、模块化的现代架构上,更新、部署、回滚都很快,扩展性和稳定性都按长期运营的标准来设计(Built for reliability, designed to scale)。

理念

这个网站最早只是一个人的笔记仓库,后来慢慢长成现在的知识中枢。设计上很克制——没有广告、没有追踪、没有推荐算法,只是干干净净地存放一些东西;既然做好了,就公开出来,万一有人用得上呢。

原则

不做大而全,不做平台梦,保持简单、保持克制、保持好奇。所有内容都由用户贡献、由用户维护:不会突然冒出付费墙,不会在角落塞广告位,也不会把你的数据卖给第三方。

更多

产品会持续迭代,站内日志页记录着每一次改动,改了什么都有迹可循;想了解这个站是怎么一步步走到今天的,翻翻日志就能看到来龙去脉。

举报

如果在这里看到涉嫌违规的内容,点对应卡片右侧的“举报”按钮就能提交,我们会尽快核实处理;也谢谢你花一点时间,一起把这里维护干净。

趋势
// 点击导航加载发现
归档
// 归档为空
最近浏览
// 暂无浏览记录
发布
// 加载中...
用户发布
// 加载中...
用户管理
// 加载中...
访问统计
// 加载中...
内容审核
// 加载中...
个人信息
// 加载中...
返回首页

Gemma 4:Google DeepMind 开源模型的最新里程碑

1970/1/1人工智能

介绍 Google DeepMind 基于 Gemini 3 技术推出的 Gemma 4 开源模型系列,覆盖从移动端到个人电脑的多规格,实现参数效率与智能水平的新平衡。

核心概览:从 Gemini 到 Gemma 的智能下沉

2026 年 4 月,Google DeepMind 正式发布了第四代开源模型系列 Gemma 4。与上一代产品线一致,Gemma 4 并非 Gemini 4 的简单瘦身版,而是直接从 Gemini 3 的研究成果和技术架构中萃取精华,其核心设计目标是 最大化单位参数的智能水平(intelligence-per-parameter)。这一理念意味着 DeepMind 不再单纯追求参数量上的堆砌,而是通过架构改良、训练策略和数据质量,让每个参数量都承载尽可能多的知识与推理能力。

型号矩阵:覆盖边缘到桌面的全场景布局

Gemma 4 发布了两个截然不同的规格簇,分别瞄准移动/物联网(IoT)设备与消费级个人电脑(PC):

边缘计算簇:E2B 与 E4B

  • 参数规模:E2B 和 E4B(约 20 亿与 40 亿参数级别,B 指代 Billion)
  • 设计定位:面向实时边缘计算,如手机、树莓派(Raspberry Pi)和 NVIDIA Jetson Nano 等嵌入式平台
  • 核心优势:支持音频与视觉实时处理,且能完全离线运行,在边缘设备上达到近零延迟(near-zero latency)
  • 工程意义:此类小型模型能够在电池供电的受限硬件上执行多模态任务,意味着无需云连接即可在本地完成语音识别、图像分类等推理,同时满足数据隐私敏感场景的合规需求。用户可以通过 Google AI Edge Gallery 直接试用和部署。

个人计算簇:12B、26B、31B

  • 参数规模:120 亿、260 亿与 310 亿参数(B 指代 Billion)
  • 设计定位:面向集成开发环境(IDE)、编程助手和智能体(Agentic)工作流等对深度推理有要求的场景
  • 核心优势:专为消费级 GPU(如 Nvidia RTX 系列显存 8GB-24GB)优化。这意味着学生、研究者与开发者能够将一台普通工作站转化为本地优先的 AI 服务器,无需依赖云端 API 即可流畅运行前沿级推理模型。
  • 访问方式:可直接通过 Google AI Studio 在线体验。

值得注意的是,在 31B 尺寸上,Google 公开表明其部分基准测试已接近或超越某些 100B+ 级别的闭源模型,这直接印证了"智能-参数量比"这一设计哲学的成效。

关键能力:不止于多语言的全面进化

Gemma 4 系列的核心能力覆盖了当前大模型应用的四大维度:

1. 智能体工作流(Agentic Workflows)

模型原生支持函数调用(Function Calling),这是构建自主智能体的基石。开发者可创建能够自主规划步骤、操作应用程序界面(基于 GUI Agent 范式)、并代表用户执行多步骤任务的代理系统。与早期版本不同,Gemma 4 的指令微调版本在工具选择顺序和参数填充方面的错误率显著下降,更适合可靠的生产环境部署。

2. 多模态推理(Multimodal Reasoning)

Gemma 4 虽然不能像 Gemini 系列那样直接生成视频,但具备强大的音频与视觉理解能力。支持音频波形级别的特征识别(如说话者分离、环境声学理解)以及高分辨率图像内容的深度推理(如表格结构还原、复杂图表数据提取)。这使其能够直接处理来自车载摄像头、工业传感器或医疗影像的多模态数据流。

3. 140 种语言支持

跨语言能力定义为"超越翻译"——模型能够理解特定语言的文化语境。例如,在日语中根据敬语体系调整语气,在阿拉伯语中内嵌宗教与地域礼貌惯例。这背后得益于 Gemini 3 技术中更深层次的跨语种词嵌入对齐机制。

4. 可微调性与架构效率

针对特定业务,开发者可以在自有硬件上使用 JAX、Keras、PyTorch 等主流框架,通过 LoRA、QLoRA 或全参数微调来适配垂直领域。同时,模型架构采用稀疏激活或 MoE(混合专家)技术(尤见于 E4B 与 26B 的变体),保证在消费级瓦数预算下实现高效的预填充和解码吞吐。

基准测试:全面数据透视

下面将 Gemma 4 的四个指令微调版本与上一代 Gemma 3 27B IT 进行对表对比。所有数据截至 2026 年 4 月 2 日,来自官方模型卡。

基准 (Benchmark) 评测维度 Gemma 4 31B IT Gemma 4 26B A4B IT Gemma 4 E4B IT Gemma 4 E2B IT Gemma 3 27B IT
Arena AI (text) 综合竞技场(Elo 分) 1452 1441 — — 1365
MMMLU 多语言问答(无工具) 85.2% 82.6% 69.4% 60.0% 67.6%
MMMU Pro 多模态推理 76.9% 73.8% 52.6% 44.2% 49.7%
AIME 2026 数学竞赛(无工具) 89.2% 88.3% 42.5% 37.5% 20.8%
LiveCodeBench v6 竞赛级编程题 80.0% 77.1% 52.0% 44.0% 29.1%
GPQA Diamond 科学知识问答 84.3% 82.3% 58.6% 43.4% 42.4%
τ2-bench 智能体工具调用(零售) 86.4% 85.5% 57.5% 29.4% 6.6%

数据解读

  1. 代际碾压:在 27B 级别的对决中,Gemma 4 31B 相较于 Gemma 3 27B 在数学(AIME)与智能体工具调用(τ2-bench)上实现了数倍准确率提升。尤其值得关注的是,τ2-bench 从 6.6% 飙升至 86.4%,说明新一代模型在真实 API 调用、订单处理等序列决策任务上完全脱胎换骨。
  2. 小型模型潜力:Gemma 4 E4B(约 4B 参数的视觉语言模型)即已超越 Gemma 3 27B 的多模态推理成绩(52.6% vs 49.7%)。在数学与编程能力上,E4B 的绝对数值虽低于大尺寸版本,但在手机端部署场景中,42.5% 的 AIME 准确率已足以辅助数学解题教育。
  3. 稀疏型 26B 突出:26B A4B 表示总参数 26B 但推理时仅激活 4B(Activate 4 Billion)。它仅以微小的差距落后于密集型的 31B(如数学差 0.9%),这表明 DeepMind 成功调和了稀疏架构中"知识存储"与"动态路由"之间的冲突。

以上结果均为官方在受限提示词(No tools 列)下的报道,官方全部数据集与评测脚本均已在模型卡中披露,支持第三方复现验证。

安全与信任基础

Gemma 4 系列在安全层面享有与 Google 闭源旗舰模型同等规格的基础设施级安全协议——这意味着从训练数据筛查(来源追踪、敏感信息去重)开始,到权重发布前的对抗性红队测试,再到推理时的输出过滤,每一环节都经受了国防级审查。对于政府机构和金融企业而言,选择 Gemma 4 意味着获得一份可审计、可追溯的透明度,同时满足 SOC 2、ISO 27001 等合规要求。DeepMind 指出,企业可以在隔离的私有云或物理服务器上独立部署该开源权重,彻底避免公有云 API 传输带来的泄露风险。

部署选项与生态整合

为了加速模型的分发与应用,Gemma 4 全系权重已同步上传至多个主流平台:

  • 模型托管:Hugging Face、Kaggle、Ollama、LM Studio、Docker Hub
  • 运行框架:JAX、Keras、Google AI Edge、Cactus、Gemini Enterprise Agent Platform
  • 基础设施服务:Google Kubernetes Engine(GKE)、无服务器推理端点

其中特别值得关注的是与 Unsloth 的合作——Unsloth 是一款针对消费级 GPU 的高效微调引擎,它能将 31B 模型在单张 24GB 显存的 RTX 4090 上完成 LoRA 微调而无需模型并行或梯度累计,极大降低了开发者尝试微调的门槛。

技术深度解读:三处值得关注的设计细节

  1. 稀疏激活的语境平移:26B A4B 并非简单的 8 选 2 MoE(Mixture of Experts),官方提示其采用"非均匀专家路由"——即对于多模态输入中的视觉 token 与文本 token,分配不同数量的专家参与计算。这让视觉特征的提取(通常更耗算力)不再限制文本解码速度。

  2. 函数调用的原生化:在 Gemma 3 中,工具使用依赖提示词模板引导模型输出 JSON 结构体;在 Gemma 4 中,模型预测头(LM Head)被扩展出专门的 tool-logits 分支。这使得模型能采用二分搜索的方式为外部 API 生成参数列表,将工具调用的失败率降低了接近一个数量级,真正的 Agentic 生产可用度由此建立。

  3. 视觉编码器的分辨率自适应:边缘型号(E2B/E4B)内置了动态 Patch 采样策略。面对低功耗摄像头输入时,模型按需在板载内存中仅解码图像关键区域(如人脸区域或文字行),而不必处理整张 1024x1024 像素图,从而在紧凑内存中实现 1080p 级别感知。

总结与展望

Gemma 4 标志着开源模型的另一转折:当 Meta 的 Llama 系列在追求更大参数规模时,DeepMind 用 31B 的小钢炮证明了智能并不完全与规模挂钩。特别是 4B 级别的模型在长尾科学问答(GPQA 58.6%)中几乎干掉了上一代 27B 模型(42.4%),这意味着端侧 AI 的智能水位线被大幅抬高。对于开发者而言,今天已经可以在一台 2000 美元的笔记本电脑上,通过 Ollama 运行一个能够在代码、数学、智能体场景中达到 2023 年最先进水平的模型,而所有这一切均是 Apache 2.0 协议的完全开源形态。

原文链接:https://deepmind.google/models/gemma/gemma-4/

编写使用方法
Markdown 格式 · Ctrl+Enter 确定
新建笔记
预览
数据表格
点击单元格编辑 · Tab 移动
A1fx
Sheet1
BIH1H2≡🔗</>
隐私提醒

取消
编辑工具
取消