马斯克的SpaceXAI发布新模型Grok 4.7
在大模型技术快速演进的背景下,马斯克的SpaceXAI终于推出了新一代模型Grok 4.7。这个新模型于北京时间9月22日正式发布,官方表示其为公司迄今为止功能最强大的编程和知识处理模型。马斯克也转发评论称,“Grok 4.7展现出智能、速度与成本的三重优势”。
从第一批的评测反馈来看,Grok 4.7表现出了一定的水平提升,但并没有显著领先于市场竞争对手。尽管在长时间智能体任务和编程测试方面取得了显著进展,但在网页、3D场景制作及可视化编程等实际应用中,仍然存在一些问题,表现参差不齐。
根据AI评测机构Artificial Analysis的相关数据,Grok 4.7在智力指数评测中得分46,排名第六,使得SpaceXAI进入全球前四的AI实验室行列。官方博客提到,该模型可在处理复杂任务时更加高效,并具备良好的自我检查能力,同时还配备了完善的安全机制。其速度是同类模型的两倍,成本却只有一半。 qy球友会官网
与Grok 4.6相比,Grok 4.7采用了更新更大的基础模型,并经过了更长时间的强化学习训练,同时任务难度有所增加,更加关注需要耗费数小时完成的挑战。因此,它在验证自身工作和处理长文档上下文方面的表现有所提升。
评测显示,本次升级最显著的变化发生在智能体与编程环境中。在AA-Briefcase的长时程智能体知识工作基准测试中,Grok 4.7仅次于Claude Opus 5和Claude Fable 5.1,表现出更真实的工作场景模拟,适用于数据分析、产品管理及企业战略等领域。
编程能力方面,Grok 4.7与官方编程智能体Grok Build搭配使用,在编程智能体指数中得分56,排名第四,仅逊色于Claude Fable 5.1、GPT-6 Astra以及Claude Opus 5。价格方面,Grok 4.7的标准版使用成本与前一版本相同,都是每百万输入token 2美元,每百万输出token 6美元。同时,官方还会推出速度更快的版本,其输出速度是标准版的两倍,价格也相应增加。 qy球友会官网
尽管从价格上看,Grok 4.7在尖端模型中算是低廉,但由于其处理任务时消耗的token更多,实际的成本优势存疑。测试显示,Grok 4.7在完成智能指数任务时,输出token的使用量约为8.1万,而Grok 4.6为3.6万,GPT-6 Astra则为2.7万,分别增加了125%和196%。
对于按量付费的开发者来说,比较的关键在于完成任务的时间和成本,这些仍需要更多的实际测试来验证。据一些用户反馈,在网页、3D场景及可视化编程方面,Grok 4.7的表现并不稳定,某些情况下的生成效果未达预期,且耗费的成本较高。
尽管如此,少数测试和案例并不能全面反映模型的全部性能,生成效果受到推理机制、智能体工具、上下文长度以及测试环境等诸多因素的影响。但这些初步结果表明,基准测试中的领先不一定能保证在所有实际应用中的一致表现。 qy球友会官网
对于Grok 4.7的期望,有部分支持者认为外界期待过高。此前马斯克曾表示,Grok 4.7的整体能力大致相当于Claude Opus 5,而在不同任务上可能会出现胜负交替的情况。真正的重大改进被预计在下一代的4.8版本中实现,而Grok 4.9则可能达到Anthropic的Mythos级别。
由于效果未如预期,Grok 4.7的发布经历了几次延期。早在7月,马斯克便开始预告新模型,并在8月表示需再等几周,经过调整后终于发布。与此同时,马斯克也开始为下一代模型的发布进行预热,透露Grok 4.8将是一款参数量达到2.5万亿的AI模型,并计划在近期完成训练与强化学习。
虽然SpaceXAI拥有优质资源,但在最新模型未能进入前三的情况下,显然仍需在下一代模型上加倍努力。 qy球友会官网
中国游泳在亚运会的卓越表现与孙杨的历史贡献
训练课程内容丰富多样,从基本技术到战术安排,教练带领我们逐步提高,让我对足球更加热爱!...
浙江大学揭示脑出血患者的四大共同特征
训练课程内容丰富多样,从基本技术到战术安排,教练带领我们逐步提高,让我对足球更加热爱!...