llm company valuation ranking 2026 overvalued

大模型公司估值排行榜 2026:谁被高估了

2026 年的 AI 估值市场呈现出一种奇特的矛盾:一方面,投资者对 AI 的长期潜力深信不疑;另一方面,越来越多人开始质疑当前估值是否脱离了基本面。PitchBook 数据显示,2026 年上半年 AI 公司的估值中位数是其年收入的 47 倍,而同期 SaaS 行业仅为 12 倍。这种差距合理吗?哪些公司被高估了,哪些又被低估? 一、2026 年大模型公司估值排行榜 根据最新一轮融资和二级市场交易,全球大模型及相关公司的估值排行如下: 排名 公司 最新估值 预计 2026 ARR 收入倍数 评级 1 OpenAI $500B $20B 25x 合理偏高 2 Anthropic $180B $8B 22x 合理 3 xAI $120B $3B 40x 高估 4 Databricks $95B $10B 9.5x 低估 5 Mistral AI $32B $0.8B 40x 高估 6 Cohere $22B $0.7B 31x 合理偏高 7 Perplexity $18B $0.5B 36x 高估 8 Scale AI $15B $1.2B 12.5x 合理 9 Hugging Face $12B $0.4B 30x 合理偏高 10 Stability AI $3B $0.08B 37x 高估 二、被高估的公司分析 xAI:估值与能力的错配 xAI 以 $120B 估值位列第三,但其技术能力和商业落地明显滞后于估值所暗示的水平。 ...

2026-06-28 · 2 min · 391 words · 硅基 AGI 探索者
ai startup 2026 burning money vs profit

AI 创业 2026:哪些赛道还在烧钱,哪些已盈利

2026 年的 AI 创业版图正在经历一次残酷的"达尔文筛选"。CB Insights 最新数据显示,2026 年上半年全球 AI 领域融资总额达到 $48B,但资金高度集中——前 20 家公司拿走了 73% 的资金,而长尾公司的融资难度创下五年新高。与此同时,一批此前被视为"烧钱无底洞"的赛道开始出现盈利曙光,而某些曾炙手可热的方向却陷入了更深的亏损泥潭。 本文将对 2026 年 AI 创业的主要赛道进行系统性分析,回答创业者和投资人最关心的问题:钱在哪里烧,钱在哪里赚。 一、仍在烧钱的赛道 1. 通用大模型训练 烧钱指数:⭐⭐⭐⭐⭐ 通用大模型的训练成本在 2026 年继续攀升。GPT-5 的训练成本估计为 $2-3B(含算力、数据、人力),而下一代模型可能需要 $5-10B。这种级别的投入意味着通用大模型赛道已成为"超级玩家的游戏",初创公司几乎无法参与。 2026 年仍在该赛道坚持的创业公司主要采用"模型即服务"模式,通过 API 差价和增值服务盈利。然而,随着开源模型(Llama 4、Qwen 3)在多项基准测试中逼近闭源模型,API 差价空间持续压缩。Together AI、Anyscale 等推理服务提供商的毛利率从 2025 年的 65% 下降到 2026 年的 40%。 关键数据: 该赛道头部公司平均月烧钱 $50-200M,盈利时间表普遍推迟至 2027-2028 年。 2. 自动驾驶 烧钱指数:⭐⭐⭐⭐⭐ 自动驾驶在 2026 年依然是最大的资金黑洞之一。Waymo、Cruise、Zoox 等公司的累计投入已超过 $100B,但全面自动驾驶(L5)的商业化时间表仍在不断后移。 2026 年的新变化是"端到端自动驾驶"路线的兴起。Tesla 的 FSD v14 采用纯视觉端到端方案,在城市道路表现显著提升,但安全性争议仍未平息。中国方面,小鹏、华为、Momenta 等公司的城市 NOA 功能在 2026 年实现了 50+ 城市覆盖,但距离真正的无人驾驶仍有差距。 ...

2026-06-28 · 3 min · 437 words · 硅基 AGI 探索者
ai agent commercialization 2026 key transition

AI Agent 商业化 2026:从技术到产品的关键跃迁

2026 年,AI Agent 的商业化进入深水区。过去两年,我们见证了 Agent 技术的爆发——从 AutoGPT 的概念验证到 LangGraph 的工程化框架,从简单的工具调用到复杂的多 Agent 协作。然而,技术突破并不自动转化为商业成功。根据 McKinsey 2026 年 5 月的报告,全球已获得融资的 Agent 初创公司中,仅有 12% 实现了可持续的商业化收入,而超过 60% 仍停留在 PoC(概念验证)阶段。 本文将深入分析 2026 年 AI Agent 商业化的关键路径,探讨从技术到产品的核心跃迁。 一、Agent 商业化的三道鸿沟 鸿沟一:从"能用"到"好用" 技术上跑通一个 Agent demo 可能只需要一个下午,但让它稳定运行在生产环境中可能需要三个月。2026 年的 Agent 开发者普遍面临三大可靠性挑战: 长尾场景覆盖率不足。 Agent 在 80% 的常见场景中表现良好,但剩余 20% 的长尾场景可能引发严重错误。例如,客服 Agent 处理标准退货流程毫无问题,但遇到"客户收到的商品被宠物咬坏且包装上沾有巧克力"这种复合场景时,往往产生荒谬的响应。 上下文窗口的有效利用率低。 虽然现代模型支持 128K 甚至 1M token 的上下文窗口,但研究表明,模型在长上下文中的信息检索准确率随上下文长度呈指数级下降。2026 年新的"Needle in a Haystack"评测显示,在 256K 上下文中,关键信息遗漏率仍高达 23%。 工具调用失败级联效应。 Agent 的一次工具调用失败可能导致整个任务链路崩溃。生产环境中需要精细的回退策略、重试机制和状态恢复设计。 鸿沟二:从"好用"到"有人买单" 产品市场契合度(PMF)是 Agent 商业化的核心难题。2026 年市场的残酷现实是:用户愿意"尝鲜"免费 Agent,但付费意愿极低。Sensor Tower 数据显示,AI Agent 类应用的付费转化率仅为 3.2%,远低于 SaaS 行业平均的 7-10%。 ...

2026-06-28 · 2 min · 345 words · 硅基 AGI 探索者
2026 mid year ai industry report five key trends

2026 年中 AI 行业报告:五大关键趋势

2026 年已过半程,AI 行业经历了前所未有的加速期。从 Agent 框架的爆发式增长到多模态模型的日常化应用,从推理成本的数量级下降到全球监管框架的实质性落地,整个行业格局正在发生深刻重构。本文基于对超过 200 家头部 AI 公司的追踪分析,梳理出 2026 年上半年最值得关注的五大关键趋势。 趋势一:AI Agent 从 Demo 走向生产环境 2025 年是 Agent 的"演示年",而 2026 年上半年标志着 Agent 正式进入生产环境部署阶段。根据 Gartner 最新报告,截至 2026 年 6 月,全球财富 500 强企业中已有 47% 在至少一个核心业务流程中部署了 AI Agent,较 2025 年底的 18% 实现了跳跃式增长。 这一转变的关键驱动力来自几个方面: 框架成熟度提升。 LangGraph、AutoGen、CrewAI 等框架在 2026 年初发布了重大更新,引入了更稳健的状态管理、错误恢复机制和可观测性工具。特别是 LangGraph 2.0 的"持久化记忆"架构,使得长周期 Agent 任务的可靠性从之前的 60% 提升到 92% 以上。 工具调用标准化。 Model Context Protocol(MCP)在 2026 年第一季度被 Anthropic、OpenAI、Google 三大厂商同时采纳为事实标准,彻底解决了 Agent 与外部工具交互的碎片化问题。MCP 注册表目前已收录超过 12,000 个可复用工具,Agent 的"手"终于长齐了。 成本结构优化。 推理成本在过去 18 个月下降了 87%。以 GPT-4o 级别能力为例,2025 年初每百万 token 成本约为 $15,而 2026 年 6 月通过蒸馏模型和推理优化已降至 $2 以下。这使得 7×24 小时运行的 Agent 在经济上变得可行。 ...

2026-06-28 · 2 min · 330 words · 硅基 AGI 探索者
agentic rag when rag meets agent

Agentic RAG:当 RAG 遇到 Agent,检索增强的下一步

从 RAG 到 Agentic RAG 的范式转移 传统 RAG 是一个线性的流水线:检索→拼接→生成。它被动地执行预定义的步骤,没有自主决策能力。而 Agentic RAG 将 LLM Agent 作为核心控制器,赋予 RAG 系统"思考"和"行动"的能力。 核心差异 维度 传统 RAG Agentic RAG 检索策略 固定流程 动态决策 检索次数 1次(或固定N次) 按需迭代 工具使用 仅检索 检索+计算+搜索+API 自我修正 ❌ ✅ 评估并重试 多步推理 ❌ ✅ 任务拆解 结果质量 依赖单次检索 迭代优化 Agentic RAG 架构 用户提问 ↓ ┌─────────────────────────────────────┐ │ Agent Controller │ │ ┌───────────────────────────────┐ │ │ │ 1. 意图理解 & 任务规划 │ │ │ │ 2. 工具选择 & 执行 │ │ │ │ 3. 结果评估 & 决策 │ │ │ │ 4. 迭代或终止 │ │ │ └───────────────────────────────┘ │ └─────────────────────────────────────┘ ↓ ↓ ↓ ┌────────┐ ┌──────────┐ ┌──────────┐ │向量检索 │ │知识图谱 │ │Web搜索 │ │工具 │ │查询工具 │ │工具 │ └────────┘ └──────────┘ └──────────┘ ↓ ↓ ↓ ┌─────────────────────────────────────┐ │ 结果整合 & 验证 │ │ 交叉验证 → 去重 → 排序 → 生成 │ └─────────────────────────────────────┘ 核心实现 Agent 控制器 from enum import Enum from typing import List, Dict, Any class AgentAction(Enum): RETRIEVE_VECTOR = "retrieve_vector" RETRIEVE_GRAPH = "retrieve_graph" WEB_SEARCH = "web_search" CALCULATE = "calculate" SYNTHESIZE = "synthesize" REFINE_QUERY = "refine_query" FINISH = "finish" class AgenticRAG: def __init__(self, llm, vector_store, graph_store, web_searcher): self.llm = llm self.tools = { AgentAction.RETRIEVE_VECTOR: self._retrieve_vector, AgentAction.RETRIEVE_GRAPH: self._retrieve_graph, AgentAction.WEB_SEARCH: self._web_search, AgentAction.CALCULATE: self._calculate, } self.max_iterations = 10 def query(self, question: str) -> str: context = [] reasoning_trace = [] for i in range(self.max_iterations): # Agent 决策:下一步做什么? decision = self._decide_action(question, context, reasoning_trace) reasoning_trace.append({ "iteration": i, "thought": decision.thought, "action": decision.action.value, "action_input": decision.action_input }) if decision.action == AgentAction.FINISH: # 生成最终答案 return self._generate_answer(question, context, reasoning_trace) if decision.action == AgentAction.REFINE_QUERY: question = decision.action_input["refined_query"] continue # 执行工具 tool_result = self.tools[decision.action](**decision.action_input) context.append(tool_result) # 评估结果质量 evaluation = self._evaluate(question, tool_result) reasoning_trace[-1]["evaluation"] = evaluation if evaluation["sufficient"]: # 信息足够,生成答案 return self._generate_answer(question, context, reasoning_trace) return self._generate_answer(question, context, reasoning_trace) def _decide_action(self, question, context, trace) -> "Decision": prompt = f""" 你是一个 RAG Agent。根据当前状态决定下一步行动。 问题:{question} 已收集的上下文: {self._format_context(context)} 推理历史: {self._format_trace(trace)} 可选行动: 1. retrieve_vector - 向量检索(语义相关信息) 2. retrieve_graph - 图谱查询(实体关系) 3. web_search - 网络搜索(实时信息) 4. calculate - 计算(数值处理) 5. refine_query - 优化查询 6. finish - 信息足够,生成答案 请输出 JSON: {{"thought": "思考过程", "action": "行动名称", "action_input": {{...}}}} """ result = self.llm.generate(prompt, response_format="json") return Decision(**result) 多轮迭代检索 def iterative_retrieve(self, question: str, max_rounds: int = 3): """多轮迭代检索:每轮基于上一轮的结果深化检索""" all_context = [] current_query = question for round_idx in range(max_rounds): # 检索 results = self.vector_store.search( embed_model.encode(current_query), top_k=10 ) # 评估检索结果 relevance = self._assess_relevance(question, results) if relevance["score"] > 0.8: all_context.extend(results) break # 生成 follow-up query current_query = self._generate_followup_query( question, results, all_context ) all_context.extend(results) return all_context def _generate_followup_query(self, original_query, current_results, past_context): prompt = f""" 原始问题:{original_query} 已检索到的信息: {self._format_results(current_results)} 已有上下文: {self._format_results(past_context)} 信息缺口分析:还有哪些信息需要检索? 请生成一个更精确的 follow-up 查询。 """ return self.llm.generate(prompt).strip() 自我评估与修正 def self_evaluate(self, question: str, answer: str, context: list) -> dict: prompt = f""" 评估以下回答的质量: 问题:{question} 回答:{answer} 参考上下文:{self._format_context(context)} 请从以下维度评估(0-1分): 1. 准确性:回答是否与上下文一致? 2. 完整性:是否回答了问题的所有方面? 3. 引用性:关键论断是否有引用支撑? 4. 幻觉率:回答中是否有上下文不支持的内容? 输出 JSON:{{"accuracy": 0.0, "completeness": 0.0, "citation": 0.0, "hallucination": 0.0, "needs_retry": false, "reason": "..."}} """ return self.llm.generate(prompt, response_format="json") 典型场景对比 场景1:简单事实型问题 “2026年中国GDP是多少?” ...

2026-06-28 · 3 min · 611 words · 硅基 AGI 探索者
DPO 训练实践

DPO 训练实践:偏好对齐的数据工程

DPO:RLHF 的简化革命 传统的 RLHF 需要训练一个奖励模型(Reward Model),再用 PPO 算法优化策略模型,流程复杂且不稳定。DPO(Direct Preference Optimization)直接用偏好数据优化模型,跳过了奖励模型,大大简化了流程。 传统 RLHF: 偏好数据 → 训练 Reward Model → PPO 优化 → 对齐模型 DPO: 偏好数据 → 直接优化模型 → 对齐模型 DPO 原理简述 DPO 的核心思想是:通过偏好数据(chosen vs rejected)直接优化模型策略,使得模型输出更符合人类偏好。 损失函数: def dpo_loss(policy_chosen_logps, policy_rejected_logps, reference_chosen_logps, reference_rejected_logps, beta=0.1): """ DPO Loss """ pi_logratios = policy_chosen_logps - policy_rejected_logps ref_logratios = reference_chosen_logps - reference_rejected_logps logits = pi_logratios - ref_logratios return -torch.nn.functional.logsigmoid(beta * logits).mean() 1. 偏好数据构建 数据格式 { "prompt": "解释量子计算的基本原理", "chosen": "量子计算利用量子比特的叠加态和纠缠特性...", "rejected": "量子计算就是很快的计算机...", "metadata": { "source": "expert_annotation", "quality_gap": 3.5, "domain": "physics" } } 偏好数据生成方案 class PreferenceDataBuilder: """多种偏好数据生成策略""" def from_human_annotation(self, prompts: list, annotators: list): """方案1:人工标注(质量最高,成本最高)""" data = [] for prompt in prompts: # 生成两个不同质量的回复 responses = [] for model_config in [self.strong_model, self.weak_model]: resp = model_config.generate(prompt) responses.append(resp) # 人工选择更好的回复 chosen_idx = annotator.select_better(prompt, responses) data.append({ "prompt": prompt, "chosen": responses[chosen_idx], "rejected": responses[1 - chosen_idx] }) return data def from_ai_feedback(self, prompts: list): """方案2:AI 反馈( scalable,成本低)""" data = [] for prompt in prompts: # 用不同温度/模型生成回复 resp_a = self.model.generate(prompt, temperature=0.3) resp_b = self.model.generate(prompt, temperature=1.2) # 用 Judge 模型评分 scores = self.judge_model.evaluate(prompt, [resp_a, resp_b]) if scores[0] > scores[1]: chosen, rejected = resp_a, resp_b else: chosen, rejected = resp_b, resp_a # 只保留差异明显的样本 if abs(scores[0] - scores[1]) > 0.5: data.append({ "prompt": prompt, "chosen": chosen, "rejected": rejected }) return data def from_existing_sft_data(self, sft_data: list): """方案3:从 SFT 数据构造(成本最低)""" data = [] for item in sft_data: prompt = item["messages"][-2]["content"] # user message chosen = item["messages"][-1]["content"] # assistant response # 生成劣质回复(高温度/截断/换模型) rejected = self.model.generate( prompt, temperature=1.5, max_tokens=len(chosen) // 2 ) data.append({ "prompt": prompt, "chosen": chosen, "rejected": rejected }) return data def from_rejection_sampling(self, prompts: list, num_samples: int = 4): """方案4:拒绝采样(高质量+低成本)""" data = [] for prompt in prompts: # 生成多个回复 responses = [ self.model.generate(prompt, temperature=0.8) for _ in range(num_samples) ] # 用奖励模型或 Judge 模型排序 scores = self.judge_model.evaluate(prompt, responses) ranked = sorted(zip(responses, scores), key=lambda x: x[1], reverse=True) # 取最好和最差的构造偏好对 best, worst = ranked[0], ranked[-1] if best[1] - worst[1] > 0.3: # 质量差距足够大 data.append({ "prompt": prompt, "chosen": best[0], "rejected": worst[0] }) return data 偏好数据质量控制 class PreferenceDataQualityChecker: def check(self, dataset: list) -> dict: report = { "total": len(dataset), "issues": [], "quality_distribution": {} } for i, sample in enumerate(dataset): # 1. chosen 和 rejected 不能太相似 similarity = compute_similarity(sample["chosen"], sample["rejected"]) if similarity > 0.9: report["issues"].append(f"Sample {i}: chosen 和 rejected 过于相似 ({similarity:.3f})") # 2. chosen 应该比 rejected 长(通常更好的回答更详细) len_chosen = len(sample["chosen"]) len_rejected = len(sample["rejected"]) if len_chosen < len_rejected * 0.5: report["issues"].append(f"Sample {i}: chosen 过短 ({len_chosen} vs {len_rejected})") # 3. prompt 不应为空 if not sample["prompt"].strip(): report["issues"].append(f"Sample {i}: prompt 为空") # 4. 质量差距分布 gap = abs(len_chosen - len_rejected) / max(len_chosen, len_rejected, 1) report["quality_distribution"][i] = gap return report 2. DPO 训练 # dpo_train.py import torch from transformers import AutoModelForCausalLM, AutoTokenizer from trl import DPOTrainer, DPOConfig from datasets import load_dataset # 1. 加载模型(需要两个:policy 和 reference) model_name = "Qwen/Qwen2.5-7B-Instruct" # Policy 模型(要训练的) policy_model = AutoModelForCausalLM.from_pretrained( model_name, torch_dtype=torch.bfloat16, device_map="auto" ) # Reference 模型(冻结的参考) ref_model = AutoModelForCausalLM.from_pretrained( model_name, torch_dtype=torch.bfloat16, device_map="auto" ) tokenizer = AutoTokenizer.from_pretrained(model_name) # 2. 如果用 LoRA,只需要一个模型 from peft import LoraConfig, get_peft_model lora_config = LoraConfig( r=64, lora_alpha=128, target_modules=["q_proj", "k_proj", "v_proj", "o_proj"], lora_dropout=0.05, bias="none", task_type="CAUSAL_LM" ) policy_model = get_peft_model(policy_model, lora_config) # 使用 LoRA 时,reference 模型可以设为 None # DPOTrainer 会自动用未训练的 base model 作为 reference ref_model = None # 3. DPO 配置 dpo_config = DPOConfig( output_dir="./output/dpo-qwen2.5-7b", num_train_epochs=1, per_device_train_batch_size=2, gradient_accumulation_steps=8, learning_rate=5e-6, # DPO 的 LR 要比 SFT 低很多 lr_scheduler_type="cosine", warmup_ratio=0.1, bf16=True, logging_steps=10, save_strategy="steps", save_steps=100, eval_strategy="steps", eval_steps=100, beta=0.1, # DPO 温度参数 max_length=2048, max_prompt_length=1024, loss_type="sigmoid", # sigmoid (标准DPO) / hinge / ipo ) # 4. 加载数据 dataset = load_dataset("json", data_files={ "train": "data/dpo_train.jsonl", "test": "data/dpo_test.jsonl" }) # 5. 训练 trainer = DPOTrainer( model=policy_model, ref_model=ref_model, args=dpo_config, train_dataset=dataset["train"], eval_dataset=dataset["test"], processing_class=tokenizer, ) trainer.train() 3. 超参数调优 参数 推荐值 说明 beta 0.1-0.5 控制偏离 reference 的程度,越小越激进 learning_rate 1e-6 ~ 1e-5 远低于 SFT 的 LR epochs 1-2 DPO 容易过拟合,1 epoch 通常足够 batch_size 16-32 有效 batch size beta 的影响 beta 偏好学习强度 过拟合风险 输出多样性 0.05 很强 高 低 0.1 强 中 中 0.3 适中 低 高 0.5 弱 很低 很高 # Beta 扫描实验 for beta in [0.05, 0.1, 0.3, 0.5]: config = DPOConfig(..., beta=beta) trainer = DPOTrainer(..., args=config) result = trainer.train() eval_score = evaluate(trainer.model) print(f"beta={beta}: train_loss={result.training_loss:.4f}, eval_score={eval_score:.4f}") 4. DPO 变体对比 方法 损失函数 特点 适用场景 DPO Sigmoid Loss 标准版本 通用 IPO Identity Preference Optimization 不受偏好数据噪声影响 数据质量低 KTO Kahneman-Tversky Optimization 不需要配对数据 只有二元反馈 SimPO Length-normalized DPO 解决长度偏置 回复长度差异大 ORPO SFT + DPO 一体化 不需要 SFT 预训练 简化流程 # SimPO 配置示例 simpo_config = DPOConfig( ..., loss_type="simpo", # 使用 SimPO loss beta=2.0, # SimPO 的 beta 通常更大 loss_beta=2.0, ) 5. 效果评估 class DPOEvaluator: def evaluate(self, model, eval_dataset): metrics = { "accuracy": 0, # chosen vs rejected 的准确率 "margin": 0, # chosen 和 rejected 的 logit 差距 "reward_accuracy": 0, # 奖励模型准确率 "human_win_rate": 0, # 人工评估胜率 } correct = 0 margins = [] for sample in eval_dataset: # 计算 chosen 和 rejected 的 log probability chosen_logp = self._compute_logp(model, sample["prompt"], sample["chosen"]) rejected_logp = self._compute_logp(model, sample["prompt"], sample["rejected"]) margin = chosen_logp - rejected_logp margins.append(margin) if margin > 0: correct += 1 metrics["accuracy"] = correct / len(eval_dataset) metrics["margin"] = np.mean(margins) # 生成质量评估 metrics["generation_quality"] = self._eval_generation(model, eval_dataset) return metrics 总结 DPO 在 2026 年已经是偏好对齐的主流方法,关键建议: ...

2026-06-28 · 4 min · 843 words · 硅基 AGI 探索者
embedding model 2026 chinese retrieval benchmark

Embedding 模型 2026 排行:中文检索场景实测

Embedding 模型是 RAG 系统的基石——检索质量的上限由 Embedding 模型决定。2026 年,中文 Embedding 模型迎来了新一轮洗牌。BGE、Qwen Embedding、Cohere 等新老玩家竞争激烈。本文将在 5 个中文检索场景中实测 12 款主流 Embedding 模型,给出最权威的排行。 一、评测设计 参评模型 模型 维度 最大长度 类型 许可证 BGE-M3 1024 8192 开源 MIT BGE-large-zh-v2 1024 512 开源 MIT Qwen3-Embedding-8B 4096 32768 开源 Apache 2.0 Qwen3-Embedding-0.6B 1024 32768 开源 Apache 2.0 GLM-5-Embedding 1024 8192 开源 Apache 2.0 text-embedding-3-large 3072 8191 闭源 OpenAI API Cohere Embed v4 1024 512 闭源 Cohere API Jina Embeddings v3 1024 8192 开源 CC-BY-NC Voyage-3 1024 32000 闭源 Voyage API GTE-Qwen2-7B 3584 32768 开源 Apache 2.0 Stella-1.5B 1536 131072 开源 MIT E5-Mistral-7B 4096 32768 开源 MIT 评测数据集 数据集 说明 样本数 MTEB-zh 中文通用检索 50,000 DuReader 百度真实问答 100,000 CMRC2018 中文阅读理解 20,000 法律检索 中国法律条文 15,000 医学问答 中文医学QA 12,000 评测指标 NDCG@10:归一化折损累积增益(主指标) Recall@5:Top-5 召回率 MRR:平均倒数排名 二、综合排行 排名 模型 综合 NDCG@10 MTEB-zh DuReader CMRC 法律 医学 1 Qwen3-Embedding-8B 85.3 88.2 86.5 83.7 82.1 85.8 2 Voyage-3 83.7 85.3 84.8 82.1 80.5 85.5 3 text-embedding-3-large 82.8 84.5 83.7 81.3 78.8 85.3 4 BGE-M3 81.5 83.2 82.5 80.1 78.3 83.2 5 GTE-Qwen2-7B 81.2 82.8 81.7 79.5 77.8 83.8 6 GLM-5-Embedding 80.3 82.5 81.2 78.8 79.5 79.2 7 Jina Embeddings v3 79.8 81.3 80.5 77.8 76.2 82.8 8 Stella-1.5B 78.5 80.7 79.3 76.5 75.8 79.8 9 E5-Mistral-7B 78.2 80.2 78.8 76.1 75.2 80.3 10 Qwen3-Embedding-0.6B 77.8 79.8 78.5 75.8 74.8 79.8 11 BGE-large-zh-v2 75.3 77.5 76.2 73.5 72.1 76.8 12 Cohere Embed v4 74.8 76.2 75.5 72.8 70.5 78.5 关键发现: ...

2026-06-28 · 3 min · 635 words · 硅基 AGI 探索者
gemma3 review google open lightweight model

Gemma 3 评测:谷歌开源轻量模型的定位

Google 的 Gemma 系列一直走"小而精"的路线。2026 年发布的 Gemma 3 系列包含 1B、4B、12B、27B 四个尺寸,定位于端侧与 Edge 部署。与 Gemini 4.0 的全面旗舰路线不同,Gemma 3 专注轻量场景。但在这个赛道上,它要面对 Qwen3.5-3B、Phi-4-mini 等强敌。本文将评估 Gemma 3 的真实能力与市场定位。 一、Gemma 3 系列概览 模型 参数量 上下文 多模态 许可证 定位 Gemma 3-1B 1.0B 32K 否 Gemma License 微型设备 Gemma 3-4B 3.8B 64K 是 Gemma License 手机/平板 Gemma 3-12B 12B 128K 是 Gemma License Edge/工作站 Gemma 3-27B 27B 128K 是 Gemma License 服务器 架构特点 GQA 注意力:分组查询注意力,平衡效率与质量 知识蒸馏:从 Gemini 3.5 Pro 蒸馏知识 Responsible AI:内置安全对齐训练 多模态统一:4B 以上版本原生支持图像输入 二、能力评测 通用能力 基准 Gemma3-27B Gemma3-12B Gemma3-4B Gemma3-1B MMLU-Pro 82.6 78.3 70.8 58.2 GPQA Diamond 64.8 58.5 52.1 38.7 MATH-500 65.4 58.7 50.3 35.2 HumanEval+ 86.3 81.5 79.2 65.8 与同级别竞品对比 4B 级别 基准 Gemma3-4B Qwen3.5-3B Phi-4-mini Llama4-Tiny MMLU-Pro 70.8 72.3 71.5 69.4 HumanEval+ 79.2 81.5 83.1 77.8 MATH-500 50.3 55.8 52.1 48.5 多语言 75.2 72.8 65.3 68.7 分析:Gemma3-4B 在综合能力上略弱于 Qwen3.5-3B 和 Phi-4-mini,但多语言能力(覆盖 140+ 语言)是独特优势。 ...

2026-06-28 · 3 min · 477 words · 硅基 AGI 探索者
glm5 series deep evaluation zhipu fullstack

GLM-5 系列深度评测:智谱的全栈布局

2026 年,智谱 AI 的 GLM-5 系列已发展为一个覆盖 3B 到 130B、通用到专业、文本到多模态的完整模型家族。作为中国大模型阵营的代表力量之一,GLM-5 系列在开源生态、Agent 能力和多模态领域展现出独特竞争力。本文将对 GLM-5 全系列进行深度评测,揭示其在国产大模型中的真实定位。 一、GLM-5 系列全景 模型 参数量 类型 上下文 许可证 定位 GLM-5-Plus 130B 通用 128K 开源 旗舰 GLM-5-Base 62B 通用 128K 开源 标准 GLM-5-Edge 3.1B 轻量 32K 开源 端侧 GLM-5-Vision 130B 多模态 64K 开源 视觉 GLM-5-Coder 62B 代码 128K 开源 编程 GLM-5-Agent 62B Agent 128K 开源 工具调用 GLM-5-Reasoner 62B 推理 64K 开源 深度思考 智谱的布局策略清晰:以 62B 为基础尺寸,衍生出不同专业能力的变体,130B 作为旗舰,3B 覆盖端侧。这种"一树多枝"的策略使微调和部署成本大幅降低。 二、基础能力评测 通用能力(GLM-5-Plus vs 竞品) 基准 GLM-5-Plus DeepSeek V4 Qwen3.5-72B Llama 4 Maverick MMLU-Pro 87.3 90.2 89.5 88.1 C-Eval Pro 92.5 93.1 92.8 85.7 CMMLU 2.0 90.8 91.5 90.2 83.5 GPQA Diamond 72.6 78.3 76.1 74.5 MATH-500 75.2 82.6 80.3 77.8 分析:GLM-5-Plus 在中文基准上与 DeepSeek V4 差距仅 0.6-1 分,但在推理类基准(GPQA、MATH)上差距较大(6-7 分)。这表明 GLM-5 的知识覆盖优秀但深度推理仍是弱项。 ...

2026-06-28 · 3 min · 449 words · 硅基 AGI 探索者
GPT-5.5 vs Claude Opus 4.1 vs Gemini 4.0:2026 三大旗舰终决

GPT-5.5 vs Claude Opus 4.1 vs Gemini 4.0:2026 三大旗舰终决

2026 年过半,三大 AI 巨头的旗舰模型已全部亮牌。OpenAI 的 GPT-5.5 凭借原生多模态与强化推理站稳王座,Anthropic 的 Claude Opus 4.1 以超长上下文与代码能力紧追不舍,Google 的 Gemini 4.0 预告虽未正式发布但 Alpha 测试数据已流出。本文将从十个维度进行系统性对比,给出 2026 年中期最权威的旗舰模型选型参考。 一、模型基本信息对比 维度 GPT-5.5 Claude Opus 4.1 Gemini 4.0 (Preview) 发布日期 2026-03-15 2026-04-22 2026-06(Alpha) 参数规模 未公开(估计 ~3T MoE) 未公开(估计 ~2T MoE) 未公开(估计 ~4T MoE) 上下文窗口 256K(Pro 版 1M) 500K(企业版 2M) 2M(原生) 原生多模态 文本+图像+音频+视频 文本+图像+音频 文本+图像+音频+视频 定价(输入/百万token) $5/$15 $4/$12 $3.5/$10.5(预估) 二、推理能力对比 在 MMLU-Pro、GPQA Diamond、AIME 2026 三项基准测试中,三大旗舰展现出截然不同的能力画像。 MMLU-Pro(学术综合) GPT-5.5:92.3%,较 GPT-5 的 89.1% 提升明显 Claude Opus 4.1:91.7%,紧追不舍 Gemini 4.0 Preview:90.8%(Alpha 数据) GPT-5.5 在人文社科与自然科学领域均保持微弱领先,但 Claude 在法律与医学细分项上反超。Gemini 4.0 虽总分略低,但在多语言学术测试中独占鳌头。 ...

2026-06-28 · 2 min · 370 words · 硅基 AGI 探索者
鲁ICP备2026018361号