
亚马逊云科技(AWS)旗下 Strands 团队于当地时间 10 月 1 日发布了开源决策模型 Strands Decider 2B。该模型已在代码托管平台 GitHub 上开源,模型权重可在 Hugging Face 获取,并可在本地 CPU 或 GPU 上运行。
与常规大语言模型不同,Strands Decider 2B 并不生成文本,而是专为”做选择题”而生:面对一组预设选项,它直接输出选择结果,并给出对本次判断的置信度评分。这类模型被称为”决策模型”或”系统 1 模型”,最早由初创公司 TypeSafe 发布的 Jev 引发业界关注——Jev 的命名来源于经济学家威廉·斯坦利·杰文斯(William Stanley Jevons)。
架构:在 Qwen3.5-2B 之上换装微型”指针头”
Strands Decider 2B 基于预训练的 Qwen3.5-2B 作为”躯干”,用一枚仅含约一百万参数的小型”指针头”替换了原本负责文本生成的模型头部。这一新头部规模很小,躯干部分则通过秩为 16 的 LoRA 适配器进行微调。官方表示,该设计可在保留语言理解能力的同时,把隐藏状态直接匹配到答案位置的评分上。
在公开数据集 JevBench 上,Strands Decider 2B 取得了不错的准确率与校准度表现。其在 2B 参数级别模型中排名第三,优于所有严格不超过 20 亿参数的同类竞争对手。在常见硬件上本地运行时,该模型的决策时延中位数为 113 毫秒;在英伟达 GeForce RTX 3090 显卡上执行小型决策任务的中位数时延为 153 毫秒。
为什么需要”决策模型”
Strands Decider 2B 由亚马逊杰出工程师马克·布鲁克(Marc Brooker)在尝试构建自己的 Jev 版本后发起,内部试用阶段曾一度登上同规模模型的 JevBench 榜首,随后由亚马逊的 Strands Labs 整理后正式发布。布鲁克向 TechCrunch 表示,这一需求的灵感部分来自与 AWS 客户的交流:在构建智能体工作流时,并非每一步都需要完整大语言模型的能力与成本。
对于智能体而言,这类模型可以在”下一步该搜索信息、调用工具,还是进入下一阶段”之间快速决策,并附上置信度信号,使工作流步骤更可预测,同时降低时延与潜在的调用成本。布鲁克也指出,开发者需要在决策准确率、校准度与模型所保留的通用知识之间取得平衡。TypeSafe 创始人兼 CEO 迪奥戈·阿尔梅达(Diogo Almeida)则认为,要让这类模型真正”聪明”起来,技术挑战可能比当前热度所显示的更大。
值得注意的是,据 TechCrunch 报道,在亚马逊发布同周,OpenAI 也宣布了类似 Jev 的产品。决策模型这一细分方向正在快速升温,反映出开发者正探索用不同规模的模型分担自动化工作流中不同环节的趋势。
如何获取
目前,Strands Decider 2B 的代码库、训练脚本与示例已在 GitHub 上线,模型权重可通过 Hugging Face 下载。开发者可将其用于模型路由、工具选择、上下文管理与策略分类等重复性任务,从而构建”混合智能体”架构:由决策模型处理简单选择,大语言模型专注复杂推理。







