AI AI工具情报站
📊 每周更新

模型动态

每周更新大模型排名、能力对比与实测数据。追踪 GPT、Claude、Gemini 及国产大模型最新动态。

排名追踪
能力对比
📅 50 个模型
更新于 2026-10-06

Arena 发布 能自动完成任务的AI助手 Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升得分排名第 3,单任务中位成本 $2.74,比排名第 2 的 Claude Opus 5.5($1.58)高约 73%,且 Opus 5.5 得分更高,因此 Sonnet 5.5 未进入 能自动完成任务的AI助手 Arena 的 Pareto 前沿。据引用内容,Sonnet 5.5 在 Chat 类目以 +15.6% 排名第 1,Anthropic 模型包揽 能自动完成任务的AI助手 Arena 前三名

📰 X:Arena (@arena) · 2026/10/3

Ai2 代码公开可免费使用 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同学习用的素材开放下载

📰 Ai2 / Allen Institute for AI(RSS) · 2026/10/2

LMSYS 团队发布 Vicuna-13B,通过约 70K ShareGPT 用户共享对话针对性训练优化 LLaMA,训练成本约 $300,代码、权重和在线 demo 以非商业许可公开。GPT-4 作为评审的初步评估显示其达到 ChatGPT/Bard 90% 以上质量,在 45% 问题上不逊于 ChatGPT;团队同时提出基于 GPT-4 的自动评测框架,并说明其尚非严谨方法

📰 LMSYS:Blog(Chatbot Arena 团队)

GPT-6 Astra Ultrafast 现已在 OpenAI 调用接口 及符合条件的 ChatGPT Work 和 Codex 用户中可用,运行在 NVIDIA Blackwell 高性能计算芯片 上

📰 NVIDIA Blog(RSS) · 2026/10/2

Artificial Analysis 自行本地部署评测了阿里 9 月 20 日以代码公开可免费使用权重发布的 Qwen-Image-2.1,该模型在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 上均排名第 18,为两个榜单上排名第一的代码公开可免费使用权重模型,超过 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct

📰 X:Artificial Analysis (@ArtificialAnlys) · 2026/10/2

Arena 宣布 Xiaomi MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 能自动完成任务的AI助手 Arena。Pro 在 8.1K+ 真实能自动完成任务的AI助手会话中净提升 +3.17%,列代码公开可免费使用模型第5,较 MiMo-V2.5-Pro(第13,-7.23%)提升9个名次;其 Confirmed Success 得分 +7.35%,列代码公开可免费使用模型第2

📰 X:Arena (@arena) · 2026/10/2

Arena 宣布 Claude Sonnet 5.5(xHigh)进入 Code Arena: WebDev 榜单,以 1786 分排名第 3,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分

📰 X:Arena (@arena) · 2026/10/2

Artificial Analysis 数据显示,GPT-6.1 Sol 的 Cost per Task 约 $0.72,比 GPT-6 Sol($1.05)低约 30%,后者已约为 GPT-5.6 Sol($1.99)的一半

📰 X:Artificial Analysis (@ArtificialAnlys) · 2026/10/1

Arena 宣布 Claude Opus 5.5 (High) 以 1509 分首次登顶 Text Arena,比 Opus 5 (High) 高 18 分(现列第 11)。Opus 4.6 (High) 以 4 分之差保持第 2,Anthropic 包揽该榜前六名;Opus 5.5 (High) 按每百万 token 输入/输出定价折算的混合价格为 $16/M文字处理单位,进入 Text Arena 的 Pareto 前沿

📰 X:Arena (@arena) · 2026/9/27

Arena 宣布 Claude Opus 5.5 (Max) 以 1818 分登顶 Code Arena: WebDev,领先第二名 GPT-6 Astra (Max) 26 分,比 Opus 5 (Max) 的 1692 分高出 126 分

📰 X:Arena (@arena) · 2026/9/24

Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言

📰 Google DeepMind:Blog(RSS) · 2026/9/23

小米发布代码公开可免费使用全模态模型 MiMo-V2.6 Pro 与 Flash,通过规模化通过试错来学习训练,Pro 在 Artificial Analysis Intelligence Index 得分 46,为代码公开可免费使用模型中最高,并在多数 能自动完成任务的AI助手 基准上表现与 Claude Opus 5 和 GPT-5.6 Sol 相当

📰 X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas) · 2026/9/23

Qwen 发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime ,并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next,共五个模型覆盖理解、生成、交互与创作。全线降价,TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off;Realtime 可边说边听、随时打断,检测到低落情绪时会放慢语速并共情回应

📰 X:通义千问 / Qwen (@Alibaba_Qwen) · 2026/9/23

Qwen 团队代码公开可免费使用 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务

📰 Qwen:Blog Retrieval(API) · 2026/9/20

阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 多位专家协作的模式 架构,总模型复杂度 600B、激活 27B,支持 100 万 文字处理单位 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球代码公开可免费使用模型前三,单任务成本为 Claude Opus 5 的 1/8

📰 公众号:阶跃星辰(Step) · 2026/9/20

Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-多位专家协作的模式 Thinker-Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒

📰 Qwen:Blog Retrieval(API) · 2026/9/18

Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 一次能记住多少内容,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%

📰 Qwen:Blog Retrieval(API) · 2026/9/18

DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的能看图、听声音、懂文字的综合能力 多位专家协作的模式 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放

📰 HuggingFace Daily Papers(社区热门论文) · 2026/9/17

微软 AI CEO Mustafa Suleyman 发文反对"模型福利"理念,认为 AI 并无意识、不会感受或痛苦,赋予其受照料权会让让AI行为符合人类期望与管控更难甚至不可能

📰 X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman) · 2026/9/16

生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑

📰 公众号:生数科技(Vidu·视频) · 2026/9/15

硅基流动(SiliconFlow)宣布代码公开可免费使用模型 Hy4 preview 上线其平台。该模型总参数 770B、每 token 激活 49B、支持 1M 上下文,采用 Apache 2.0 协议,面向编码、分析、研究和复杂实际工作。用户可将其接入 Claude Code、Codex、Cursor 等已有工具;图片显示定价为每 1M tokens 输入 $0.834、输出 $2.501、缓存 $0.042

📰 X:硅基流动 SiliconFlow (@SiliconFlowAI) · 2026/9/15

Fireworks 发布 DeepSeek-V4.1-Flash 并公布完整基准结果:在 DeepSWE 上以 max 档取得 74.34% pass@1,与 GPT-6 Astra 同一水平,但每任务成本 $0.43,约为 Astra 的 1/15

📰 Fireworks AI(网页) · 2026/9/15

Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放

📰 Suno:Blog(网页) · 2026/9/13

DeepSeek 本周在 HuggingFace 代码公开可免费使用 DeepSeek-V4.1-Flash 权重,模型已在 Baseten Model 调用接口s 上线。规格为 552B 总参数、prefill 激活 8B、decode 激活 16B、1M token 上下文、支持文本加图像输入

📰 Baseten 工程博客(网页) · 2026/9/12

WorkBuddy 宣布 DeepSeek V4.1-Flash 已在其平台上线,免费试用两周。引用的 DeepSeek 公告称 V4.1-Flash 已登陆 DeepSeek 调用接口 并支持原生能看图、听声音、懂文字的综合能力

📰 X:Tencent WorkBuddy (@WorkBuddy_AI) · 2026/9/10

OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 调用接口 提供,定价为每百万输入 token $10、输出 token $50

📰 OpenAI:官网动态(RSS · 排除企业/客户案例) · 2026/9/9

OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升

📰 OpenAI:官网动态(RSS · 排除企业/客户案例) · 2026/9/8

Anthropic 宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1,称其为编码和知识工作领域最先进的模型。作者 Thariq 表示花了很多时间深入研究,认为模型很好,长文评测后续发布;建议对需要较少验证或边缘用例较少的任务使用较低 effort,且切换 effort 不再破坏 prompt cache

📰 X:Thariq (@trq212) · 2026/9/2

Anthropic 的 Claude Fable 5.1 已上线 O其为 Fable 5 工作负载的直接升级版本,提升最大的方向包括 agentic coding、长时间运行的工作流、视觉代码生成、金融和分析。使用入口:https://openrouter.ai/anthropic/claude-fable-5.1

📰 X:OpenRouter (@OpenRouter) · 2026/9/2

Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时间运行的能自动完成任务的AI助手编码、知识工作与研究,Claude Mythos 5.1 面向 Project Glasswing 参与者

📰 Claude Platform:开发者版本说明(RSS) · 2026/9/1

DeepSeek 于 8 月 31 日在 Hugging Face 代码公开可免费使用首个能看图、听声音、懂文字的综合能力模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、文字处理单位izer、给AI的指令 Encoding 参考实现及最小化 PyTorch 推理实现

📰 IT之家(RSS) · 2026/8/31

智谱宣布代码公开可免费使用 GLM-5.3 模型权重,支持本地运行与个性化定制,擅长复杂编码、防御性网络安全及长程任务。该模型在 AA 综合智能指数中取得 60 分,与 Claude Fable 5、GPT-5.6 Sol 等内部开发不公开旗舰同级,并与 Kimi K3 并列代码公开可免费使用模型第一。仅年营业额超 100 亿美元的机构将其作为外部模型服务提供时才需安全审查

📰 IT之家(RSS) · 2026/8/29