gemma model guide

Google Gemma 模型指南:轻量级开源选择

Gemma 系列概览 Gemma 是 Google 基于 Gemini 技术推出的开源轻量级模型系列。与 Gemini 的闭源 API 不同,Gemma 面向开源社区,权重可下载、可本地部署、可商用。其定位是"开发者友好的 Gemini 同源技术"。 产品线演进 Gemma 1 (2024.02) Gemma 2 (2024.06) Gemma 3 (2025.03) ┌──────────────┐ ┌──────────────┐ ┌──────────────┐ │ 2B / 7B │ │ 2B / 9B / 27B│ │ 1B / 4B │ │ 文本 only │───→ │ 文本 only │───→ │ 12B / 27B │ │ 8K 上下文 │ │ 8K 上下文 │ │ 多模态(视觉) │ │ Gemma 许可 │ │ GQA 引入 │ │ 128K 上下文 │ └──────────────┘ └──────────────┘ └──────────────┘ Gemma 2 架构 Gemma 2 引入了多项与 Gemini 同源的架构改进: ...

2026-06-24 · 3 min · 605 words · AI 实战派
deepseek v4 完整版发布 开源模型的新巅峰

DeepSeek V4 完整版发布:开源模型的新巅峰

DeepSeek V4 完整版:开源模型的「GPT-4 时刻」 2026 年 6 月,DeepSeek 正式发布 V4 完整版(此前 Preview 版已流传数月)。这是目前最强的开源权重大模型,在多个维度上逼近甚至超越闭源旗舰。 架构亮点 MoE 规模:V4 采用 236B 总参数,每次激活 39B,16 个专家,路由策略采用「稀疏激活 + 专家冗余」。相比 V3,专家专业化程度更高,代码专家、数学专家、推理专家分工明确。 MLA(Multi-head Latent Attention)升级到 V2:KV Cache 压缩比达到 8:1,意味着同样的显存可以处理 8 倍长的上下文。这是 DeepSeek 在推理效率上的核心竞争优势。 1M 上下文:通过 YaRN + 增量预训练实现,长上下文扩展训练数据达到 100B tokens。在 800K token 内的 Needle-in-haystack 测试通过率 97.2%。 原生多模态:V4 是 DeepSeek 第一个原生多模态版本,支持图像输入(文本输出),视觉编码器采用独立训练的 ViT,通过 cross-attention 与语言模型融合。 基准测试成绩 基准 DeepSeek V4 GPT-5.5 Claude Opus 4.1 MMLU-Pro 89.7 91.2 90.1 GPQA Diamond 72.4 75.8 73.1 SWE-Bench 82.3% 85.7% 84.1% HumanEval+ 91.5% 93.2% 92.8% C-Eval 96.8 88.3 85.7 中文能力是 DeepSeek V4 的最大优势,在 C-Eval 和 CMMLU 上大幅领先所有闭源模型。 ...

2026-06-24 · 1 min · 157 words · 硅基 AGI 探索者
qwen35 发布 阿里通义的全面进化

Qwen3.5 发布:阿里通义的全面进化

Qwen3.5:阿里通义的「全尺寸」攻势 2026 年 6 月,阿里巴巴发布 Qwen3.5 系列,这是 Qwen3 发布一年后的重大升级。最大亮点是「全尺寸覆盖」——从 0.8B 到 397B MoE,六个型号全面覆盖端侧到云端。 模型矩阵 型号 参数 激活参数 适用场景 Qwen3.5-0.8B 0.8B 0.8B 端侧、嵌入式 Qwen3.5-3B 3B 3B 手机、边缘设备 Qwen3.5-8B 8B 8B 单卡部署、中小团队 Qwen3.5-32B 32B 32B 高性能单机 Qwen3.5-72B 72B 72B 企业级部署 Qwen3.5-397B-A17B 397B 17B 旗舰,对标 GPT-5 核心技术改进 GQA + MLA 混合注意力:Qwen3.5 是第一个同时采用 Grouped Query Attention 和 Multi-head Latent Attention 的模型,在推理效率和长上下文能力之间找到最佳平衡点。 MoE 路由优化:397B-A17B 版本采用「动态专家容量」,每个 token 可根据难度动态分配专家数量(1-3 个),在保持推理效率的同时提升困难样本的处理能力。 中文能力再突破:在 C-Eval 2.0(2026 版)上达到 98.1%,创下新的 SOTA。特别是对于中文古文、方言、专业术语的理解能力大幅提升。 原生工具调用:Qwen3.5 原生支持 Tool Calling,不需要特殊 Prompt 格式。在 Berkeley Function-Calling 上达到 94.2%,开源模型第一。 ...

2026-06-23 · 1 min · 167 words · 硅基 AGI 探索者
llama 4 系列全面评测 meta 的开源反击

Llama 4 系列全面评测:Meta 的开源反击

Llama 4:Meta 的开源反击能否成功? Meta 在 2026 年 Q2 正式发布 Llama 4 系列,包含三个型号:Scout(17B)、Maverick(120B)、Behemoth(400B+ MoE)。这是 Meta 在开源大模型领域的全面反击,直接对标 Qwen3.5 和 DeepSeek V4。 模型家族 Llama 4 Scout(17B):面向端侧和单卡部署,采用密集 Transformer 架构,支持 128K 上下文。 Llama 4 Maverick(120B):旗舰密集模型,支持 256K 上下文,针对多模态优化。 Llama 4 Behemoth(400B+ MoE,激活 80B):对标 GPT-5.5 和 Claude Opus 4.1 的旗舰型号,采用 MoE 架构。 架构创新 Early Fusion 多模态:Llama 4 采用 Early Fusion 视觉架构,图像 patch 在第一层就与文本 token 融合(类似 Gemini 4.0 的思路),而不是像 Llama 3.2 那样用单独视觉塔。 Grouped Query Attention V2:升级版 GQA,支持动态头数分配,在长上下文场景下 KV Cache 占用减少 60%。 ...

2026-06-22 · 1 min · 208 words · 硅基 AGI 探索者
鲁ICP备2026018361号