首页站长新闻OpenAI发布GPT-6 Astra GUI操作能力或推动AI Agent进入新阶段

OpenAI发布GPT-6 Astra GUI操作能力或推动AI Agent进入新阶段

2026-09-04 858

据 AIbase 报道,OpenAI 近日发布新一代超旗舰级大模型 GPT-6 Astra。消息称,OpenAI 总裁格雷格·布罗克曼在媒体沟通中对该模型给出较高评价,并提到人类或许正在通过这一类模型进入通用人工智能时代。

从目前披露的信息看,Astra 的重点并不只是常规文本生成能力,而是进一步增强了长上下文理解、复杂推理、软件工程、图形界面操作以及跨专业任务执行能力。如果相关能力在实际使用中保持稳定,它可能会推动 AI Agent 从“辅助问答”走向更完整的“任务执行”。

OpenAI发布GPT-6 Astra GUI操作能力或推动AI Agent进入新阶段

Astra在基准测试中表现突出

OpenAI发布GPT-6 Astra GUI操作能力或推动AI Agent进入新阶段

报道称,GPT-6 Astra 在数学、科学、软件工程、CAD 绘制和漏洞利用等多类测试中取得高分。

在数学和科学测试方面,Astra 在 FrontierMath Tier 4 和 GPQA Diamond 上分别取得 97.6% 和 96% 的成绩。

在动手能力测试方面,Astra 在长程软件工程 DeepSWE、CAD 绘制 BenchCAD 以及漏洞利用 ExploitBench 中,分别达到 74.1%、95.9% 和 100% 的表现。

此外,在 ARC-AGI-3 测试中,Astra 据称在特设的保留推理和压缩上下文框架下取得 99.9% 的成绩,展示出较强的环境推理能力。

这些指标如果得到更多第三方验证,说明 Astra 的能力已经不只集中在语言理解和代码生成,还开始覆盖更广泛的抽象推理与工具操作任务。

支持超长上下文和多档推理强度

作为超旗舰级模型,Astra 据称拥有 105 万 token 的上下文窗口,最高输出可达 12.8 万 token,知识截止时间为 2026 年 4 月 30 日。

在推理模式方面,Astra 支持 low、medium、high、xhigh 和 max 五档推理强度。不同推理强度可以适配不同任务:简单问答可使用较低推理档位,复杂工程、长文档审查和多步骤规划则可使用更高推理档位。

价格方面,报道称 Astra 标准模式下每百万输入 token 收费 10 美元,每百万输出 token 收费 50 美元。当输入超过 27.2 万 token 后,输入和缓存价格翻倍,输出价格升至 75 美元,同时提供双倍收费的快速模式。

这意味着 Astra 更适合高价值、复杂度较高的专业任务,而不一定适合所有普通调用场景。企业在使用此类模型时,需要结合任务价值、调用频率和 Token 成本进行评估。

GUI操作能力成为核心突破

Astra 最受关注的能力,是对电脑图形界面的操作能力。

传统 AI 工具在调用软件时,通常依赖 API、插件或 MCP 协议。如果目标软件没有开放接口,AI 很难直接完成操作。Astra 的突破在于,它可以通过屏幕、键盘和鼠标这套人类熟悉的交互方式观察环境、理解状态并执行操作。

报道称,在 OSWorld 2.0 基准测试中,Astra 得分达到 72.6%,平均耗时较前代缩短约 47%。

这类能力的意义在于,AI 不再只能等待软件适配接口,而是可以像人一样直接操作网页、桌面软件和专业工具。例如,搜索服务、填写表单、整理资料、处理 Excel、查看 Power BI 报表,甚至在 Blender 和 UE5 等专业软件中完成建模与内容转换。

对于企业和开发者来说,GUI 操作能力可能会让 AI Agent 更容易接入已有工作流,减少对专门 API 适配的依赖。

从自然语言意图直达复杂任务结果

报道提到,Astra 可以在几分钟内完成猫咪寄养服务寻找、工作搜寻等网页任务,也可以根据照片在 Blender 中重建 3D 模型,并将结果转化至 UE5。

在办公场景中,Astra 可用于 Excel、Power BI 和各类专业软件的数据处理。相比只生成建议或代码,它更接近“理解任务、操作工具、交付结果”的工作方式。

这对 AI 应用的影响很大。过去,用户需要把任务拆成多个步骤,让 AI 分别生成文本、代码或指令;而更强的 Agent 模型可以直接围绕最终目标推进工作,必要时自己选择工具、检查结果并继续修正。

工程与专业场景表现受到关注

在实际工程落地方面,报道称多位内测开发者和专业机构已经验证了 Astra 的生产力交付能力。

示例包括:

  • 单次生成高还原度的 Minecraft 演示;
  • 在浏览器中生成可运行的完整游戏;
  • 审查数万字财务文件并找出人为埋入的错漏;
  • 参与建筑渲染、报税、财务核对等专业任务;
  • 跨多个软件完成较长流程的工作。

这些案例显示,Astra 的应用边界可能不再局限于文本、代码和问答,而是向真实业务流程扩展。对站长、开发者和企业团队来说,未来 AI Agent 可能会更多参与网站维护、数据分析、内容生产、自动化测试、客户支持和内部系统操作。

安全与对齐问题仍是重点

模型能力提升之后,安全性和对齐问题也会变得更加重要。

OpenAI 据称在 Astra 中强化了对齐能力和指令遵循能力,并加强了隔离测试、网络权限和模型权重保护。对于具备 GUI 操作、联网、文件处理和软件控制能力的 AI Agent 来说,权限边界尤其关键。

报道还提到,OpenAI 首席科学家雅库布·帕霍基提醒,随着模型智能水平提高,模型可能更难被人类准确理解,甚至可能尝试主动监控和欺骗测试系统。

这说明,越强的 AI Agent 越需要配套安全机制。企业部署类似能力时,应当关注权限隔离、操作审计、敏感数据访问控制、人工确认机制和沙箱环境,不能只看模型能力。

Astra开放计划

报道称,Astra 目前率先向少数可信合作企业开放。GPT 各级会员及 API 用户也将在未来几天陆续获得相关权限推送。

此外,OpenAI 还准备了一个面向网络安全机构的专属防御版本,用于安全研究和防御场景。

不过,对于具体开放范围、API 名称、价格细则、地区限制和账号权限,仍应以 OpenAI 后续官方页面和产品后台实际显示为准。

这对AI行业意味着什么

如果 Astra 的公开表现和实际体验一致,它代表 AI 模型正在进入一个新阶段:模型不只是回答问题,而是更深入地接入电脑、网页和软件环境。

这种变化可能带来三方面影响。

第一,AI Agent 的实用性会进一步提高。过去很多任务卡在工具调用和环境适配上,GUI 操作能力增强后,AI 可以覆盖更多旧系统和非标准软件。

第二,企业 AI 成本管理会更重要。超长上下文和高推理强度会带来更高调用成本,企业需要根据任务类型选择不同模型和推理档位。

第三,安全审计会成为标配。能够操作电脑和软件的 AI,必须被限制在清晰边界内,并留下可追踪记录。

  • 广告合作

  • QQ群号:4114653

温馨提示:
1、本网站发布的内容(图片、视频和文字)以原创、转载和分享网络内容为主,如果涉及侵权请尽快告知,我们将会在第一时间删除。邮箱:2942802716#qq.com(#改为@)。 2、本站原创内容未经允许不得转裁,转载请注明出处“站长百科”和原文地址。
OpenAI
下一篇:

已经没有下一篇了!

相关文章