Liquid AI 发布 d1 决策模型,新增文本与图像输入,可通过 console.liquid.ai 和 d1 Playground 使用
模型动态
每周更新大模型排名、能力对比与实测数据。追踪 GPT、Claude、Gemini 及国产大模型最新动态。
Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 在 能自动完成任务的AI助手 Arena 排名第 5(+11.23%),中位任务成本 $0.56,并重塑了 Pareto 前沿
Arena 发布 能自动完成任务的AI助手 Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升得分排名第 3,单任务中位成本 $2.74,比排名第 2 的 Claude Opus 5.5($1.58)高约 73%,且 Opus 5.5 得分更高,因此 Sonnet 5.5 未进入 能自动完成任务的AI助手 Arena 的 Pareto 前沿。据引用内容,Sonnet 5.5 在 Chat 类目以 +15.6% 排名第 1,Anthropic 模型包揽 能自动完成任务的AI助手 Arena 前三名
Ai2 代码公开可免费使用 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同学习用的素材开放下载
LMSYS 团队发布 Vicuna-13B,通过约 70K ShareGPT 用户共享对话针对性训练优化 LLaMA,训练成本约 $300,代码、权重和在线 demo 以非商业许可公开。GPT-4 作为评审的初步评估显示其达到 ChatGPT/Bard 90% 以上质量,在 45% 问题上不逊于 ChatGPT;团队同时提出基于 GPT-4 的自动评测框架,并说明其尚非严谨方法
Artificial Analysis 发布 Coding 能自动完成任务的AI助手 Index 榜单,Claude Sonnet 5.5 (max) 在 Claude Code 以 68 分居首,但每任务成本最高达 $14.19
GPT-6 Astra Ultrafast 现已在 OpenAI 调用接口 及符合条件的 ChatGPT Work 和 Codex 用户中可用,运行在 NVIDIA Blackwell 高性能计算芯片 上
Artificial Analysis 自行本地部署评测了阿里 9 月 20 日以代码公开可免费使用权重发布的 Qwen-Image-2.1,该模型在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 上均排名第 18,为两个榜单上排名第一的代码公开可免费使用权重模型,超过 Ideogram 4.0(Quality)和 HunyuanImage 3.0 Instruct
Arena 宣布 Xiaomi MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 能自动完成任务的AI助手 Arena。Pro 在 8.1K+ 真实能自动完成任务的AI助手会话中净提升 +3.17%,列代码公开可免费使用模型第5,较 MiMo-V2.5-Pro(第13,-7.23%)提升9个名次;其 Confirmed Success 得分 +7.35%,列代码公开可免费使用模型第2
Arena 宣布 Claude Sonnet 5.5(xHigh)进入 Code Arena: WebDev 榜单,以 1786 分排名第 3,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分
Artificial Analysis 数据显示,GPT-6.1 Sol 的 Cost per Task 约 $0.72,比 GPT-6 Sol($1.05)低约 30%,后者已约为 GPT-5.6 Sol($1.99)的一半
Arena 公布 Gemini 4 Argon (High) 在 能自动完成任务的AI助手 Arena 排名第 8,净提升分 +7.92%,每任务成本 $0.62
Arena 宣布 Claude Opus 5.5 (High) 以 1509 分首次登顶 Text Arena,比 Opus 5 (High) 高 18 分(现列第 11)。Opus 4.6 (High) 以 4 分之差保持第 2,Anthropic 包揽该榜前六名;Opus 5.5 (High) 按每百万 token 输入/输出定价折算的混合价格为 $16/M文字处理单位,进入 Text Arena 的 Pareto 前沿
Arena 宣布 Claude Opus 5.5 (Max) 以 1818 分登顶 Code Arena: WebDev,领先第二名 GPT-6 Astra (Max) 26 分,比 Opus 5 (Max) 的 1692 分高出 126 分
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言
小米发布代码公开可免费使用全模态模型 MiMo-V2.6 Pro 与 Flash,通过规模化通过试错来学习训练,Pro 在 Artificial Analysis Intelligence Index 得分 46,为代码公开可免费使用模型中最高,并在多数 能自动完成任务的AI助手 基准上表现与 Claude Opus 5 和 GPT-5.6 Sol 相当
Qwen 发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime ,并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next,共五个模型覆盖理解、生成、交互与创作。全线降价,TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off;Realtime 可边说边听、随时打断,检测到低落情绪时会放慢语速并共情回应
Anthropic 发布 Claude Opus 5.5,称典型按 token 计费工作负载运行成本比 Opus 5 低约 40%,其中缓存读取降价 60%、输入输出 token 降价 20%
Qwen 团队代码公开可免费使用 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务
阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 多位专家协作的模式 架构,总模型复杂度 600B、激活 27B,支持 100 万 文字处理单位 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球代码公开可免费使用模型前三,单任务成本为 Claude Opus 5 的 1/8
Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-多位专家协作的模式 Thinker-Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒
Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 一次能记住多少内容,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的能看图、听声音、懂文字的综合能力 多位专家协作的模式 模型,支持最长 100 万 token 上下文,模型权重已在 Hugging Face 开放
微软 AI CEO Mustafa Suleyman 发文反对"模型福利"理念,认为 AI 并无意识、不会感受或痛苦,赋予其受照料权会让让AI行为符合人类期望与管控更难甚至不可能
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音能自动完成任务的AI助手和复杂任务执行
生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑
阶跃星辰发布 StepAudio 3 系列,包含 Realtime、ASR、TTS、Gen 和 Music 五款模型,已在阶跃星辰开放平台上线
硅基流动(SiliconFlow)宣布代码公开可免费使用模型 Hy4 preview 上线其平台。该模型总参数 770B、每 token 激活 49B、支持 1M 上下文,采用 Apache 2.0 协议,面向编码、分析、研究和复杂实际工作。用户可将其接入 Claude Code、Codex、Cursor 等已有工具;图片显示定价为每 1M tokens 输入 $0.834、输出 $2.501、缓存 $0.042
Fireworks 发布 DeepSeek-V4.1-Flash 并公布完整基准结果:在 DeepSWE 上以 max 档取得 74.34% pass@1,与 GPT-6 Astra 同一水平,但每任务成本 $0.43,约为 Astra 的 1/15
小红书 AllSpark 团队发布并代码公开可免费使用 Search 能自动完成任务的AI助手 模型 Iris,权重和评测代码已公开,数据与训练配方将陆续公布
Suno 发布新一代音乐模型 v6,与 Warner Music Group、BMG、Believe 等行业伙伴合作开发,后续将全面替换旧模型。v6 分为三个版本:旗舰 v6 和探索向的 v6-wild 面向 Pro 与 Premier 订阅用户,更快的 v6-mini 向所有人开放
DeepSeek 本周在 HuggingFace 代码公开可免费使用 DeepSeek-V4.1-Flash 权重,模型已在 Baseten Model 调用接口s 上线。规格为 552B 总参数、prefill 激活 8B、decode 激活 16B、1M token 上下文、支持文本加图像输入
Artificial Analysis 评测显示,DeepSeek V4.1 Flash 在 Intelligence Index 得分 40,超过 DeepSeek V4 Pro 0813 成为 DeepSeek 新旗舰,输入激活参数 8B、输出激活参数 16B,支持 1M token 上下文,MIT 许可
WorkBuddy 宣布 DeepSeek V4.1-Flash 已在其平台上线,免费试用两周。引用的 DeepSeek 公告称 V4.1-Flash 已登陆 DeepSeek 调用接口 并支持原生能看图、听声音、懂文字的综合能力
Suno 发布 v6 模型,可将图片、视频和语音备忘录转化为音乐,并对已创建的歌曲进行精确修改。同时提供 v6-wild 版本供探索更多可能性,官方附有 2 分钟以内的功能演示视频
OpenAI 发布 GPT-6 Astra,已在 ChatGPT Work、Codex 和 调用接口 提供,定价为每百万输入 token $10、输出 token $50
OpenAI 发布 ChatGPT Images 2.5 图像模型,生成延迟比 Images 2.0 降低最多 50%,细节、编辑精度、参考照片保真度和多轮编辑一致性均有提升
OpenAI 发布 GPT-6 Astra,称其在 FrontierMath Tier 4 达 98%、ARC-AGI-3 达 99.9%、ExploitBench 达 100%,并称其网络安全能力达到 Preparedness Framework 的 Critical 门槛。
OpenAI 于 9 月 3 日发布新一代AI对话助手 GPT-6 Astra,是其首个达到准备框架中关键级网络安全能力门槛的模型,可在无逐步指导下发现防护严密系统的未知漏洞。
Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现。
OpenAI 发布 GPT-6 Astra,定位为计算机操作模型,提供 1,050,000 token 上下文、128,000 最大输出 token,知识截止 2026 年 4 月 30 日,OSWorld V2-Offline 得分 72.6%,平均任务时间从约 75 分钟降至 40 分钟。
Perplexity CEO Aravind Srinivas 祝贺 OpenAI 发布 GPT-6 Astra,称其在宽度和深度研究任务上远超其他模型且更具成本效益,将很快向 Perplexity Computer 的 Pro 和 Max 用户开放。
Anthropic 宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1,称其为编码和知识工作领域最先进的模型。作者 Thariq 表示花了很多时间深入研究,认为模型很好,长文评测后续发布;建议对需要较少验证或边缘用例较少的任务使用较低 effort,且切换 effort 不再破坏 prompt cache
Anthropic 的 Claude Fable 5.1 已上线 O其为 Fable 5 工作负载的直接升级版本,提升最大的方向包括 agentic coding、长时间运行的工作流、视觉代码生成、金融和分析。使用入口:https://openrouter.ai/anthropic/claude-fable-5.1
OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知漏洞并构建利用链
Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时间运行的能自动完成任务的AI助手编码、知识工作与研究,Claude Mythos 5.1 面向 Project Glasswing 参与者
DeepSeek 于 8 月 31 日在 Hugging Face 代码公开可免费使用首个能看图、听声音、懂文字的综合能力模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、文字处理单位izer、给AI的指令 Encoding 参考实现及最小化 PyTorch 推理实现
智谱宣布代码公开可免费使用 GLM-5.3 模型权重,支持本地运行与个性化定制,擅长复杂编码、防御性网络安全及长程任务。该模型在 AA 综合智能指数中取得 60 分,与 Claude Fable 5、GPT-5.6 Sol 等内部开发不公开旗舰同级,并与 Kimi K3 并列代码公开可免费使用模型第一。仅年营业额超 100 亿美元的机构将其作为外部模型服务提供时才需安全审查
GLM-5.3 现已开放权重。 我们最强大的能自动完成任务的AI助手编码与网络防御模型,现已可供下载、运行和定制。 权重:https://huggingface.co/zai-org/GLM-5.3 技术博客:https://z.ai/blog/glm-5.3
腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,现已代码公开可免费使用并在腾讯云 文字处理单位Hub 和 OpenRouter 上线