马斯克旗下人工智能公司xAI正式发布新一代大模型Grok 4.7,并将其定位为目前最强大的编程与知识工作模型。公司表示,新模型不仅在复杂任务处理能力上实现提升,同时维持与前代产品相同的运行速度和价格体系,并以更低成本向市场发起竞争。

根据xAI公布的信息,Grok 4.7采用全新的更大规模基础模型,并在训练过程中进行了更长时间的强化学习优化。与此前版本相比,新模型所接触的训练任务更加复杂,其中大量任务设计为需要持续数小时才能完成,这使模型在长期推理、自我验证以及复杂任务管理方面获得显著增强。
xAI表示,Grok 4.7最大的变化之一在于更强的“自检能力”。模型在回答问题、完成代码编写和执行复杂知识任务时,能够更加主动地检查自身输出内容,从而降低错误率,提高最终结果可靠性。
与此同时,新模型对于超长上下文的处理能力也得到提升。面对大型文档、多轮任务以及持续时间较长的项目工作时,Grok 4.7能够维持更稳定的信息管理能力,而不会像部分传统模型那样随着上下文增长出现明显性能下降。
为了进一步改善实际工作体验,xAI还专门训练Grok 4.7原生理解Grok Bot运行框架。这意味着它不仅适用于单次问答场景,也更适合作为长期运行的智能代理参与工作流程。公司认为,这将提升模型在一般知识工作、持续对话以及企业级任务中的表现。
除了编程能力之外,Grok 4.7还被赋予更强的文档与演示文稿创作能力。官方表示,模型现在能够更好地生成专业报告、商务文件以及演示材料,希望进一步拓展其在办公自动化领域的应用范围。
性能方面,xAI公布了一系列内部测试结果。
在用于评估长周期软件工程能力的CursorBench 4.0测试中,Grok 4.7获得46.3%的成绩,相较Grok 4.6的40.4%有明显提升。在DeepSWE软件工程测试中,新模型达到71%的成绩,继续保持与行业领先产品接近的竞争水平。
在电子工程领域的EEBench测试中,Grok 4.7取得64%的成绩,较前代提升超过十个百分点。对于涉及大量专业知识和复杂工作流程的办公任务,模型在AA Briefcase测试中的表现同样有所进步。
法律分析方面,Grok 4.7在Harvey Legal Agent Benchmark测试中的得分达到19.6%,相较上一代产品进一步提高。在医疗推理领域,HealthBench Professional成绩也从48.5%提升至56.7%。
在通用知识工作领域,xAI特别强调了GDPval和AA Briefcase两项评测结果。公司认为,这些测试更接近律师、护士、金融分析师等专业人员的真实工作内容,而Grok 4.7在这些场景下已经达到当前前沿模型的竞争水平。



价格则是此次发布的另一项重要卖点。

根据官方公布的数据,Grok 4.7输入价格维持在每百万Token 2美元,输出价格为每百万Token 6美元,与Grok 4.6保持一致。相比部分前沿模型动辄数倍乃至十倍以上的费用,xAI强调Grok 4.7能够以更低成本完成相近水平的任务。
公司甚至将其描述为“以同级别模型约一半价格提供竞争性性能”的方案,希望借助成本优势进一步扩大市场份额。
安全性方面,xAI表示Grok 4.7采用了全新重建的安全防护体系。根据内部测试结果,新模型在拒绝危险请求、抵御越狱攻击以及识别高风险内容方面达到目前Grok系列最佳水平。
特别是在网络安全和生物安全等敏感领域,模型被设计为能够帮助处理合法防御性任务,同时拒绝危险或恶意用途。官方数据显示,Grok 4.7在部分网络安全风险测试和生物安全评测中均取得领先表现。
目前,Grok 4.7已经通过API和Grok平台向用户开放。开发者可以调用该模型用于编程、知识问答、文件编写以及智能代理应用开发。
随着Grok 4.7正式上线,xAI也进一步加快了产品迭代节奏。从今年7月发布Grok 4.5,到8月推出Grok 4.6,再到如今的Grok 4.7,xAI在不到三个月时间里连续完成三次重大升级。对于正在激烈竞争的人工智能市场而言,Grok 4.7不仅是一次常规更新,更显示出xAI希望通过更快迭代、更低价格和更强工作能力挑战行业领先者的战略意图。