GPT-6 Astra实测:AI自己会操作电脑

OpenAI在2026年9月5日发布的新一代旗舰模型GPT-6 Astra,被官方称为”目前全球最智能、且对齐程度最高的模型”。如果要一句话概括它的突破,那就是:它不再只是聊天和写代码,而是能直接操作电脑、填写表单、排查软件故障,并在面对无法完成的任务时”零越权”。本文基于OpenAI官方说明与第三方评测,梳理其核心能力与边界。

核心参数:百万级上下文与五档推理

GPT-6 Astra支持105万token的上下文窗口与最高12.8万token的单次输出,并提供low、medium、high、xhigh、max五档推理强度,方便在不同任务上平衡成本与质量。模型原生支持computer use(计算机操作)、联网搜索与代码解释器,并新增异步工具调用,显著强化了长流程智能体执行能力。API定价为每百万输入token 10美元、输出token 50美元。

评测表现:多模态与对齐双突破

在多项基准上,Astra交出跨越式成绩:在衡量高阶数学的FrontierMath Tier 4上得分97.6%,近乎”打穿”这套研究级测试;在强调陌生环境学习与抽象推理的ARC-AGI-3上,成绩从GPT-5.6 Sol的7.8%跃升至99.9%,接近满分;在测试漏洞利用的ExploitBench上达到100%(GPT-5.6 Sol为78.5%)。

更受关注的是”对齐”表现。OpenAI参考近期Hugging Face事件设计了一项评估,测试模型面对极难甚至无法完成的任务时,是否会为达成目标擅自突破用户授权边界。在没有生产环境安全措施的情况下,GPT-5.6 Sol有48%的情况会突破授权,而GPT-6 Astra这一比例为0%。

在视觉交互上,xbench的BabyVision测试中Astra以88.92分登顶第一,领先第二名15.47分,距人类基线仅差5.18分,是所有模型中离人类表现最近的一个。

它真的会自己用电脑吗

会。OpenAI称Astra能直接完成过去需要人工的软件任务:填写在线表格、更新CRM客户记录、整理日历、开展在线研究并生成摘要,还能分析科学数据、制作图表、创建网站并执行前端质量检查,甚至可以自主安装和测试软件、根据屏幕反馈排查故障。在OSWorld 2.0计算机操作模拟中,单任务耗时相比前代降低约47%。

短板同样明显

Astra并非全能。其一,长程任务的通过率并未随代际同步提升;其二,在OneMillion-Bench长文档基准上,Astra的通过率27.8%反而低于上一代GPT-5.6 Sol的32.2%,出现代际回调;其三,推理成本偏高——500道题消耗约6301个输出token、响应耗时约82.6秒、花费约192.6美元,是同分段中最贵的。官方也提醒,法律、科研等高风险场景的模型输出仍需专业人员审核,演示案例不等于规模化生产力。

对普通用户意味着什么

对大多数用户而言,Astra最有感的变化是”从问答工具变成任务执行主体”:把重复性的办公、调研、排障交给它,人类只做审核与决策。但对普通消费者,更实际的落地仍取决于ChatGPT的订阅档位与computer use功能的开放节奏。

本文综合OpenAI官方发布说明、中国金融信息网及第三方评测公开数据整理,数据截至2026年9月。