AI AI工具情报站
PythonApache-2.0

一个 19 亿参数的「决策模型」,比 LLM 快几十倍还自带置信度

⭐ 396 Stars

这个项目能干嘛

一句话:它是一类全新的「决策模型」(也叫 system one 模型),专门干 LLM 不擅长、传统分类器又太重的事——在给定选项里做选择、在标尺上打分,而且每次都带一个校准过的置信度。比如你喂它一句话「我的提现连着三天都失败了!」,问「该哪个团队处理?= 账单/销售/零售」,它直接回「账单,置信度 0.768」;你问「这话说得急不急?」它回一个 0 到 1 的数;你问「写作者有多烦躁?= 平静/烦躁/抑郁」,它给一个带分数的量表。它本质上是给 agent 工作流里那些「判断」环节用的轻量引擎,把反复出现的小决策从大模型调用里摘出来。

为什么最近火了

它 2026-09-29 建仓,几天到 294 star。火的逻辑很清晰:agent 现在到处都是,但 agent 内部大量的「二选一」「该调哪个工具」「这句话情绪如何」这种小判定,真去调一个大型 LLM 做,又慢又贵;自己训个分类器呢,又得数据又得功夫。strands-decider 卡在中间——它响应比 LLM 快得多(中位数 115 毫秒,RTX 3090 上),又不用像传统分类器那样专门训练。更戳人的是它给「置信度」:短文本分类任务上,它说 0.9 以上置信时,大约 95% 是对的,低于这个就建议你人工确认。这种「知道自己不确定的能力」,前沿 LLM 的推理 API 根本不暴露,而这恰恰是生产环境里最需要的——你总得知道什么时候该把决定交给人。

技术亮点

它的核心是一个 19 亿参数的模型(strands-decider-2B),中位数 115 毫秒出答案,能在 RTX 3090 上跑,也能在苹果芯片 Mac 或纯 CPU 上服务。用法很直白:命令行 strands-decider ask <模型> --state "..." --choice "问题=选项A,选项B",三种问题类型都支持——--choice 多选一、--noul 是/否打分(越接近 1 越偏 Yes)、--score 在量表上打分;还能一条命令里混着问多种类型,因为文本只加载一次。它也能当服务跑:strands-decider serve <模型> --port 8000,之后用 curl 发 JSON 请求到 /v1/systemone,返回里带 input_tokens、output_tokens 和 latency_ms(实测约 140 毫秒)。更狠的是它原生多模态:Qwen3.5-2B-Base 带 --vision 后能直接读图片(base64)作答,在 NaturalBench 上校准比图训 2B 决策器好得多(ECE 0.014 对 0.080)。Apache-2.0 协议,商用友好。

适合什么人

做 Agent 框架、路由、工具选择的工程师会最有感觉。比如让 agent 自己决定「该调搜索还是写代码」「这条用户消息该升级给人工还是自动回」「这条评论是正面还是负面」——这些高频小判定用它比调 LLM 省一个数量级的成本。ML 研究者也能拿它当「system one 模型」这个新兴方向的开箱样本,省去从零训练一个分类模型的麻烦。它单机就能跑、不要 GPU 也能服务,部署门槛低,特别适合塞进既有 pipeline 当判定中间件。

快速试用

装:pip install strands-decider。跑一个判断:strands-decider ask StrandsAgents/strands-decider-2B-hobson-v19 --state "Help! My payouts have been failing for 3 days!" --choice "Which team should handle this?=billing,sales,retail"。要当服务起就 strands-decider serve StrandsAgents/strands-decider-2B-hobson-v19 --port 8000。要读图就 pip install "strands-decider[vision]" 后加 --vision。模型权重本身从 StrandsAgents 仓库拉,首次运行会自动下载。

与竞品对比

对比大模型直答:LLM 能写任意文本但慢、贵、且不给 calibrated 置信度;decider 只做「选择/打分」这一件事,但快几十倍、还告诉你把握多大。对比传统 sklearn 分类器:分类器要你标数据、调特征、训练,decider 是通用预训练,拿来即用,覆盖「介于 LLM 和分类器之间」的那片空白。它和 Strands Agents SDK 是亲兄弟,但模型本身通用,任何 agent 框架都能接。如果说 LLM 是「系统二」(慢思考),它就是「系统一」(快直觉),专门把 agent 里那些毫秒级判定接住,让大模型专心干它擅长的深度推理。

🚀

开始使用

开源 · 可商用

Apache-2.0· Python