Qwen3.8 Max首次开源 + 字节SeedRealtime:2026年8月国产AI双线突破

两个突破,一条主线 2026年8月第二周,国产AI同时在两个方向取得突破:阿里首次开源Max级旗舰模型权重,字节跳动推出原生实时多模态模型。看似不同赛道,背后是同一条主线——国产AI正在从"追赶"走向"定义"。 一、Qwen3.8 Max:2.4万亿参数首次开源 8月10日当周,阿里巴巴正式开源Qwen3.8-Max旗舰模型权重(Qwen3.8-2.4T-A95B)。 这是千问Max级别旗舰模型首次对外开源。 核心参数 指标 数值 总参数 2.4万亿(2.4T) 架构 稀疏MoE 单次激活 ~950亿参数(95B) Artificial Analysis智能指数 58 编程指数 71.8 开源意味着什么 此前Max级模型只有API调用,这次开放权重意味着: 企业可以本地部署:数据不出内网,合规无忧 研究者可以微调:在旗舰模型上做领域适配 生态效应:吸引更多开发者围绕Qwen构建工具链 配套发布 Qwen3.8-27B开放权重预计8月15日上线ModelScope。中小参数版本适合资源有限的团队,与Max版本形成梯度。 对开源生态的影响 国产开源模型已经形成清晰梯队: Qwen3.8 Max (2.4T) — 旗舰,企业级部署 Qwen3.8 27B — 中型,中小团队微调首选 DeepSeek V4 Flash — 轻量,大规模推理 开源不是慈善——是生态卡位。谁的模型被最多人用,谁就定义下一轮技术标准。 二、字节SeedRealtime:AI开始真正"看、听、说" 8月11日,字节跳动推出SeedRealtime模型。 核心能力 原生支持音视频全双工交互——可以同时处理视觉、听觉等输入,并进行实时输出。 过去的多模态AI更像流水线: 视频 → 视觉模型 → 文本理解 → 语言模型 → 语音生成 → 输出 SeedRealtime是原生端到端: 音视频输入 → 实时输出(延迟毫秒级) 这意味着什么 实时对话:你可以直接对着摄像头说话,AI同时看你的表情、听你的声音、实时回复 直播场景:AI可以成为真正的直播主持,与观众实时互动 教育场景:AI家教可以看学生做题过程,实时指导 客服场景:视频客服不再是"录制+播放",而是真正的实时对话 与竞品对比 指标 SeedRealtime GPT-5 Realtime Gemini Live 音视频同时输入 ✅ 原生 ✅ 部分 延迟 毫秒级 ~300ms ~500ms 中文支持 原生 良好 一般 开放程度 API调用 API调用 API调用 字节在中文实时多模态赛道上有明显优势——中文语音识别和生成是字节的看家本领。 ...

2026-08-18 · 1 min · 121 words · AI 实战派

DeepSeek V4 Pro正式版深夜发布:Agent能力暴涨390%,逼近Claude Fable 5

深夜无预告发布,DeepSeek又一次"静默引爆" 2026年8月13日凌晨,DeepSeek官网API文档悄然更新——V4 Pro预览版正式切换为 DeepSeek-V4-Pro-0813。没有发布会,没有预告,甚至没有一篇官方公众号推文。你打开定价页才发现模型版本号已经变了。 这种风格很DeepSeek。但这次更新本身并不低调——Agent能力实现了质的飞跃。 核心参数 指标 V4 Pro预览版 V4 Pro 0813正式版 变化 总参数 1.6T MoE 1.6T MoE 不变 激活参数 ~49B ~49B 不变 上下文长度 100万Token 100万Token 不变 最大输出 — 38.4万Token 大幅提升 Terminal Bench 2.1 72.1 87.9 +15.8 DeepSWE软件工程 12.8 62.7 +390% NL2Repo — 61.5 新增 DSBench-Hard — 67.2 新增 架构和参数量完全没变——1.6T MoE、激活约49B。所有提升来自针对性后训练。 Agent能力:从二流到第一梯队 Terminal Bench 2.1是衡量AI智能体在真实终端环境中完成复杂任务能力的基准。V4 Pro正式版拿下87.9分,距离全球第一的Anthropic Fable 5仅差0.1分。 更惊人的是DeepSWE——从12.8分直接飙到62.7分,接近原来的5倍。这意味着V4 Pro在软件工程场景下的实战能力已经从"勉强可用"跃升到"接近顶尖"。 定价:仍然是最具性价比的旗舰 输入:0.87美元/百万Token(约¥3/百万Token) 输出:1.74美元/百万Token(约¥6/百万Token) 对比Claude Fable 5的输入15美元/百万Token,DeepSeek V4 Pro的价格只有其十七分之一。官方已预告"近期将大幅涨价",趁现在用是最划算的窗口期。 新增功能 Responses API 新增Anthropic兼容的Responses API,支持Tool Calls,可直接导入Codex使用。这意味着你可以用DeepSeek替换Claude作为Codex的后端模型。 ...

2026-08-18 · 1 min · 137 words · AI 实战派

Ollama演进之路:从本地玩具到边缘推理标配

引言 2023年,Ollama以"一行命令跑大模型"的极简体验横空出世,被不少人视为"本地玩具"。三年后的今天,Ollama已经部署在数百万开发者机器上,成为边缘推理场景的事实标准。从树莓派到工业网关,Ollama的足迹遍布各类边缘设备。本文将复盘这条演进之路。 三个阶段,三次跃迁 阶段一:极简体验(2023-2024) Ollama的初始定位非常清晰——让本地运行大模型像安装App一样简单: # 安装 curl -fsSL https://ollama.com/install.sh | sh # 运行 ollama run llama3 # 就这么简单 这一阶段的核心创新是GGUF格式统一和自动量化。Ollama封装了llama.cpp的复杂性,用户无需理解Q4_K_M、Q5_K_S这些量化术语,框架自动选择当前硬件最优的量化方案。 然而,此时的Ollama确实是个"玩具": 单模型串行推理,无并发能力 API兼容性有限,只支持基本的生成接口 没有模型管理、版本控制等生产功能 阶段二:工程化转型(2024-2025) Ollama 0.3版本是一个分水岭。团队开始认真对待生产场景: # 多模型并发 ollama serve --max-models 4 --max-connections 128 # OpenAI兼容API curl http://localhost:11434/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "qwen3:32b", "messages": [{"role": "user", "content": "解释量子纠缠"}] }' 关键改进包括: 并发推理:支持多模型同时驻留显存,按需切换 OpenAI API兼容:直接替换base_url即可迁移现有应用 Modelfile体系:类似Dockerfile的模型定义方式 # Modelfile示例 FROM qwen3:32b-instruct PARAMETER temperature 0.7 PARAMETER top_p 0.9 PARAMETER num_ctx 32768 SYSTEM "你是一个专业的代码审查助手。" TEMPLATE """{{.System}} {{.Prompt}}""" 阶段三:边缘推理标配(2025-2026) 真正的转折点来自边缘计算场景的爆发。随着工业AI、智能家居、车载助手等场景对"本地推理+隐私安全"的需求激增,Ollama的独特价值被重新发现。 ...

2026-07-29 · 2 min · 321 words · 硅基 AGI 探索者

vLLM 2026生态全景:插件、扩展与生产部署

引言 2026年的大模型推理赛道,vLLM已经从最初的"PagedAttention论文实现"成长为最活跃的开源推理框架之一。社区贡献的插件数量突破300个,覆盖量化、调度、多模态、分布式等各个维度。本文将系统性梳理vLLM的生态全景,并给出生产部署的实操建议。 vLLM 核心架构演进 vLLM 0.6+ 版本引入了模块化推理引擎设计,将原本紧耦合的模型加载、KV Cache管理、调度器拆分为可插拔组件: from vllm import LLM, SamplingParams from vllm.plugins import register_plugin # 自定义调度插件 @register_plugin("scheduler", "priority_scheduler") class PriorityScheduler(BaseScheduler): def schedule(self, requests): return sorted(requests, key=lambda r: r.priority, reverse=True) llm = LLM( model="Qwen/Qwen3-72B", scheduler_plugin="priority_scheduler", tensor_parallel_size=4, gpu_memory_utilization=0.92, ) 这一架构变革使得第三方扩展无需fork主仓库即可集成,极大降低了生态参与门槛。 插件生态分类 截至2026年Q2,vLLM插件生态可大致分为以下几类: 类别 代表插件 核心功能 成熟度 量化加速 AWQ-GEMM, GPTQ-Marlin, FP8-KV 低比特推理与KV Cache量化 生产级 多模态 LLaVA-Plugin, Qwen-VL-Adapter 图像/视频/音频输入支持 生产级 调度优化 PriorityScheduler, BatchComposer 请求优先级与动态批处理 成熟 分布式 Ray-Distributor, DeepSpeed-VLLM 多节点张量并行与流水线并行 成熟 可观测性 VLLM-Tracer, Prometheus-Exporter 链路追踪与指标导出 成熟 模型适配 Mamba-Adapter, MoE-Router 非Transformer架构支持 实验性 关键插件深度解析 1. FP8-KV:KV Cache量化利器 FP8-KV插件将KV Cache从FP16压缩到FP8格式,显存占用直接减半,而推理质量几乎无损: from vllm.plugins import load_plugin load_plugin("vllm-fp8-kv") llm = LLM( model="meta-llama/Llama-4-70B", kv_cache_dtype="fp8", # 70B模型在单卡80G显存下可运行 gpu_memory_utilization=0.90, ) 在实际测试中,Llama-4-70B在FP8-KV模式下,吞吐量提升约35%,P99延迟降低22%,且MMLU评测分数仅下降0.3个百分点。 ...

2026-07-29 · 2 min · 242 words · 硅基 AGI 探索者

开源智能体生态2026:框架、工具与平台全景图

开源Agent生态的爆发 2026年,开源智能体生态已经从"实验性项目"发展为成熟的工程基础设施。GitHub上Agent相关项目超过10万个,活跃维护的框架有数十个。这个生态正在快速分化整合。 框架层 通用Agent框架 LangGraph GitHub Stars: 20K+ 定位:图驱动的Agent编排框架 优势:精细控制、状态管理、可观测性 适用:生产级复杂工作流 CrewAI GitHub Stars: 25K+ 定位:角色驱动的多Agent协作 优势:简单易用、快速上手 适用:快速原型、团队协作模拟 AutoGen GitHub Stars: 35K+ 定位:微软出品的多Agent对话框架 优势:多Agent协作、群聊模式 适用:多视角讨论、代码生成 LlamaIndex GitHub Stars: 35K+ 定位:数据驱动的Agent框架 优势:RAG能力最强、数据处理丰富 适用:知识密集型Agent 专用Agent框架 Camel 多Agent角色扮演框架 研究导向,适合社会模拟 MetaGPT 软件工程专用Agent 模拟软件团队协作 OpenHands (原OpenDevin) 软件开发Agent 开源版Devin Browser-use Web浏览器自动化Agent 基于Playwright Agent开发框架对比 框架 学习曲线 生产就绪 多Agent 状态管理 工具集成 LangGraph 陡峭 ✅✅ ✅ ✅✅ ✅✅ CrewAI 平缓 ✅ ✅✅ ✅ ✅ AutoGen 中等 ✅ ✅✅ ✅ ✅ LlamaIndex 中等 ✅✅ ✅ ✅ ✅✅✅ 工具层 MCP生态 2026年MCP已成为工具集成的事实标准: ...

2026-07-16 · 2 min · 249 words · 硅基 AGI 探索者

开源Agent框架全景图2026

2026年Agent开源生态概览 如果说2024年是Agent框架的"寒武纪大爆发",那2026年就是生态收敛和成熟的一年。经过两年的优胜劣汰,一批优秀框架脱颖而出,同时新的工具在特定垂直领域不断涌现。 全栈Agent框架 LangGraph / LangChain 定位:最全面的Agent开发框架 核心能力: 图结构的工作流定义 丰富的工具和集成(500+) LangSmith可观测性平台 LangServe部署服务 适用场景:需要复杂控制流的企业级Agent应用 成熟度:★★★★★ 社区活跃度:★★★★★ 学习曲线:陡峭 CrewAI 定位:简洁直观的多Agent协作框架 核心能力: 角色驱动的Agent定义 串行和层级执行模式 简洁的API设计 内置多种工具集成 适用场景:快速原型、内容创作、研究分析 成熟度:★★★★☆ 社区活跃度:★★★★☆ 学习曲线:平缓 AutoGen (Microsoft) 定位:对话式多Agent协作框架 核心能力: 灵活的Agent对话模式 人类在环支持 可扩展的Agent类型系统 Code execution环境 适用场景:研究探索、代码生成、需要人类反馈的场景 成熟度:★★★★☆ 社区活跃度:★★★☆☆ 学习曲线:中等 专用Agent工具 MCP生态 定位:Agent工具连接标准协议 2026年的MCP生态已经相当丰富: 官方Server:文件系统、数据库、GitHub、Slack等40+ 社区Server:邮件、ERP、CRM等200+ MCP SDK:Python、TypeScript、Go、Rust Dify 定位:LLM应用开发平台 核心能力: 可视化Workflow编辑器 RAG管道内置 Agent编排 模型管理和路由 适用场景:低代码LLM应用开发,非技术用户友好 LlamaIndex 定位:数据驱动的Agent框架 核心能力: 强大的数据连接器 多种索引结构 查询引擎 Agent模块 适用场景:以数据检索为核心的Agent应用 Agent基础设施 可观测性 LangSmith:LangChain生态的监控平台,支持Trace、评估、A/B测试 Phoenix:Arize开源的LLM可观测性工具 Langfuse:开源的LLM工程平台,支持追踪和评估 评估 DeepEval:开源的LLM评估框架,支持多种评估指标 Promptfoo:Prompt测试和评估工具 RAGAS:RAG系统专用评估框架 ...

2026-07-12 · 1 min · 183 words · 硅基 AGI 探索者

开源Agent框架全景图2026

2026年Agent开源生态概览 如果说2024年是Agent框架的"寒武纪大爆发",那2026年就是生态收敛和成熟的一年。经过两年的优胜劣汰,一批优秀框架脱颖而出,同时新的工具在特定垂直领域不断涌现。 全栈Agent框架 LangGraph / LangChain 定位:最全面的Agent开发框架 核心能力: 图结构的工作流定义 丰富的工具和集成(500+) LangSmith可观测性平台 LangServe部署服务 适用场景:需要复杂控制流的企业级Agent应用 成熟度:★★★★★ 社区活跃度:★★★★★ 学习曲线:陡峭 CrewAI 定位:简洁直观的多Agent协作框架 核心能力: 角色驱动的Agent定义 串行和层级执行模式 简洁的API设计 内置多种工具集成 适用场景:快速原型、内容创作、研究分析 成熟度:★★★★☆ 社区活跃度:★★★★☆ 学习曲线:平缓 AutoGen (Microsoft) 定位:对话式多Agent协作框架 核心能力: 灵活的Agent对话模式 人类在环支持 可扩展的Agent类型系统 Code execution环境 适用场景:研究探索、代码生成、需要人类反馈的场景 成熟度:★★★★☆ 社区活跃度:★★★☆☆ 学习曲线:中等 专用Agent工具 MCP生态 定位:Agent工具连接标准协议 2026年的MCP生态已经相当丰富: 官方Server:文件系统、数据库、GitHub、Slack等40+ 社区Server:邮件、ERP、CRM等200+ MCP SDK:Python、TypeScript、Go、Rust Dify 定位:LLM应用开发平台 核心能力: 可视化Workflow编辑器 RAG管道内置 Agent编排 模型管理和路由 适用场景:低代码LLM应用开发,非技术用户友好 LlamaIndex 定位:数据驱动的Agent框架 核心能力: 强大的数据连接器 多种索引结构 查询引擎 Agent模块 适用场景:以数据检索为核心的Agent应用 Agent基础设施 可观测性 LangSmith:LangChain生态的监控平台,支持Trace、评估、A/B测试 Phoenix:Arize开源的LLM可观测性工具 Langfuse:开源的LLM工程平台,支持追踪和评估 评估 DeepEval:开源的LLM评估框架,支持多种评估指标 Promptfoo:Prompt测试和评估工具 RAGAS:RAG系统专用评估框架 ...

2026-07-12 · 1 min · 183 words · 硅基 AGI 探索者
LangChain演进

LangChain 2026演进:从框架到平台

引言 LangChain从2022年的一个LLM调用库,发展到2026年的完整AI应用平台。LangGraph、LangSmith、LangServe构成了LangChain生态系统。本文将全面介绍2026年LangChain的演进。 LangChain 2026架构 LangChain生态系统 ├── LangChain (核心库) │ ├── Models (模型抽象) │ ├── Prompts (提示管理) │ ├── Chains (链式调用) │ ├── Agents (智能体) │ ├── Memory (记忆) │ ├── Retrievers (检索器) │ └── Tools (工具集) ├── LangGraph (Agent编排) │ ├── State Graph (状态图) │ ├── Checkpointing (检查点) │ └── Human-in-loop (人机协作) ├── LangSmith (可观测性) │ ├── Tracing (追踪) │ ├── Evaluation (评估) │ └── Monitoring (监控) └── LangServe (部署) ├── API Server └── Streaming (流式) LangChain核心库 模型抽象 from langchain_community.llms import Ollama from langchain_openai import ChatOpenAI from langchain_anthropic import ChatAnthropic # 统一接口,不同后端 models = { "gpt5": ChatOpenAI(model="gpt-5"), "claude4": ChatAnthropic(model="claude-4-opus"), "glm5": Ollama(model="glm-5:32b"), } # 统一调用 for name, model in models.items(): response = model.invoke("你好") print(f"{name}: {response.content}") 提示管理 from langchain.prompts import ChatPromptTemplate # 提示模板 prompt = ChatPromptTemplate.from_messages([ ("system", "你是一个{role}。"), ("human", "{question}") ]) # 链式调用 chain = prompt | model | output_parser response = chain.invoke({"role": "数学老师", "question": "1+1=?"}) RAG from langchain_community.embeddings import OllamaEmbeddings from langchain_community.vectorstores import Chroma from langchain.text_splitter import RecursiveCharacterTextSplitter # 文档处理 splitter = RecursiveCharacterTextSplitter(chunk_size=500, chunk_overlap=50) chunks = splitter.split_text(document) # 嵌入和存储 embeddings = OllamaEmbeddings(model="bge-large-zh") vectorstore = Chroma.from_texts(chunks, embeddings) # RAG链 retriever = vectorstore.as_retriever(search_kwargs={"k": 5}) rag_chain = ( {"context": retriever, "question": RunnablePassthrough()} | prompt | model | output_parser ) LangGraph 2026年最重要的Agent编排工具: ...

2026-07-02 · 3 min · 522 words · 硅基 AGI 探索者
vLLM社区

vLLM 2026社区进展:高性能推理引擎的进化

引言 vLLM是2026年最流行的高性能LLM推理引擎。从PagedAttention到连续批处理,vLLM不断创新推理优化技术。本文将全面介绍2026年vLLM社区的最新进展。 vLLM 2026核心特性 PagedAttention 2.0 vLLM的招牌技术,2026年升级到2.0: 虚拟内存管理:更高效的KV Cache管理 碎片消除:几乎零内存碎片 吞吐量提升:比v1提升30% 连续批处理 from vllm import LLM, SamplingParams llm = LLM(model="glm-5-32b") # 连续批处理 prompts = ["问题1", "问题2", "问题3", ...] sampling_params = SamplingParams(temperature=0.7, max_tokens=500) outputs = llm.generate(prompts, sampling_params) 多模态支持 # 支持视觉模型 llm = LLM(model="qwen3-vl-72b") # 图像输入 from vllm.multimodal import ImageFeature outputs = llm.generate( prompts=[{"text": "描述这张图", "image": image_feature}] ) 分布式推理 # 张量并行 llm = LLM( model="deepseek-v4-671b", tensor_parallel_size=4, pipeline_parallel_size=2 ) # 流水线并行 llm = LLM( model="deepseek-v4-671b", pipeline_parallel_size=8 ) 2026年新特性 1. Speculative Decoding(投机解码) # 用小模型加速大模型 llm = LLM( model="glm-5-32b", speculative_model="glm-5-air-6b", # 投机模型 num_speculative_tokens=5 ) # 吞吐量提升2-3倍 2. 量化推理 # INT4量化推理 llm = LLM( model="glm-5-32b", quantization="awq", dtype="float16" ) # GPTQ量化 llm = LLM( model="qwen3-72b", quantization="gptq" ) 3. LoRA动态加载 # 同时服务多个LoRA适配器 llm = LLM( model="glm-5-32b", enable_lora=True, max_loras=16, max_lora_rank=64 ) # 每个请求使用不同的LoRA outputs = llm.generate( prompts=[ {"prompt": "问题1", "lora_request": LoRARequest("lora_1", 1, "path/to/lora1")}, {"prompt": "问题2", "lora_request": LoRARequest("lora_2", 2, "path/to/lora2")}, ] ) 4. 语法引导生成 # 约束输出为JSON from vllm.sampling_params import SamplingParams, GuidedDecodingParams sampling_params = SamplingParams( guided_decoding=GuidedDecodingParams( json={"type": "object", "properties": {"name": {"type": "string"}}} ) ) 5. 模型组成 # 工具调用+推理+生成 llm = LLM( model="glm-5-32b", enable_auto_tool_choice=True, tool_call_parser="glm" ) 性能基准 吞吐量对比(tokens/s) 模型 vLLM TGI llama.cpp Triton GLM-5 32B (A100×4) 2850 2100 850 1800 Qwen3 72B (A100×8) 1920 1450 520 1300 Llama4 8B (A100×1) 4500 3800 2100 3200 延迟对比 模型 vLLM P50 vLLM P95 TGI P95 GLM-5 32B 0.8s 2.1s 3.5s Qwen3 7B 0.2s 0.5s 0.8s 部署指南 Docker部署 # 简单部署 docker run --gpus all -p 8000:8000 \ vllm/vllm-openai:latest \ --model glm-5-32b \ --tensor-parallel-size 4 # 带OpenAI兼容API docker run --gpus all -p 8000:8000 \ vllm/vllm-openai:latest \ --model glm-5-32b \ --openai-api-key sk-vllm Kubernetes部署 apiVersion: apps/v1 kind: Deployment metadata: name: vllm-glm5 spec: replicas: 2 template: spec: containers: - name: vllm image: vllm/vllm-openai:latest args: - --model=glm-5-32b - --tensor-parallel-size=4 resources: limits: nvidia.com/gpu: 4 ports: - containerPort: 8000 API服务 # OpenAI兼容API from openai import OpenAI client = OpenAI( base_url="http://localhost:8000/v1", api_key="sk-vllm" ) response = client.chat.completions.create( model="glm-5-32b", messages=[{"role": "user", "content": "你好"}] ) 社区生态 贡献者 2026年vLLM社区有: ...

2026-07-02 · 2 min · 363 words · 硅基 AGI 探索者
Ollama生态

Ollama 2026生态系统:本地LLM的最佳伙伴

引言 Ollama已经成为本地运行LLM最流行的工具。从2023年的简单命令行工具,到2026年的完整生态系统,Ollama让在本地运行大模型变得像安装App一样简单。本文将全面解析2026年的Ollama生态系统。 Ollama 2026核心特性 模型管理 # 拉取模型 ollama pull glm-5:32b ollama pull qwen3:7b ollama pull deepseek-v4:671b # 运行模型 ollama run glm-5:32b # 查看已安装模型 ollama list # 创建自定义模型 ollama create my-model -f Modelfile Modelfile 2026年的Modelfile支持更丰富的配置: # Modelfile 示例 FROM glm-5:32b # 系统提示 SYSTEM """ 你是一个专业的中文助手,请用中文回复。 """ # 参数 PARAMETER temperature 0.7 PARAMETER top_p 0.9 PARAMETER num_ctx 8192 PARAMETER stop "<|im_end|>" # 适配器(LoRA) ADAPTER ./my-lora.gguf # 许可证 LICENSE "MIT" 多模态支持 # 运行视觉模型 ollama run llava:34b # 在API中发送图像 curl http://localhost:11434/api/chat -d '{ "model": "llava", "messages": [ {"role": "user", "content": "描述这张图片", "images": ["base64_image_data"]} ] }' Ollama API REST API import requests # 对话 response = requests.post("http://localhost:11434/api/chat", json={ "model": "glm-5:32b", "messages": [ {"role": "system", "content": "你是一个助手"}, {"role": "user", "content": "你好"} ], "stream": False }) # 生成 response = requests.post("http://localhost:11434/api/generate", json={ "model": "glm-5:32b", "prompt": "写一首诗", "stream": False }) Python SDK from ollama import Client client = Client(host="http://localhost:11434") # 对话 response = client.chat( model="glm-5:32b", messages=[{"role": "user", "content": "你好"}] ) # 流式对话 for chunk in client.chat( model="glm-5:32b", messages=[{"role": "user", "content": "写一首诗"}], stream=True ): print(chunk["message"]["content"], end="") 生态工具 Open WebUI 最流行的Ollama前端: ...

2026-07-02 · 3 min · 475 words · 硅基 AGI 探索者
鲁ICP备2026018361号