[新闻] xAI释出Grok 4,首度于基准测试中称冠

楼主: pooznn (我~~~是来被打脸滴!!!)   2025-07-11 22:00:46
1.媒体来源:
ithome
2.记者署名:
陈晓莉
3.完整新闻标题:
xAI释出Grok 4,首度于基准测试中称冠
4.完整新闻内文:
由马斯克(Elon Musk)创办及领军的AI新创xAI周四(7/10)发表新一代AI模型Grok 4,
第三方AI基准测试业者Artificial Analysis指出,Grok 4是xAI首款于基准测试中胜出的
模型,凌驾OpenAI、Google、Anthropic Claude与DeepSeek的高阶模型。
Grok 4是个懂得思考的推理模型,支援25.6万个Token的脉络长度,可输入文字或图像,
并生成文字。
在Artificial Analysis的模型排行榜上,Grok 4的智慧指数(Intelligence Index)为
73,胜过OpenAI o3-pro的71,或是并列70的Google Gemini 2.5 Pro、o3、o4-mini,也
超越DeepSeek R1 0528的68。
除了整体成绩之外,Artificial Analysis发现Grok 4不管是在跟程式有关的
LiveCodeBench及SciCode,或是跟数学有关的AIME24与MATH-500等测试,也都处于领先地
位。并在测试高阶科学知识的GPQA Diamond基准测试中创下88%的新纪录。
不只是Artificial Analysis,ARC Prize的模型排行榜显示Grok 4处于明显的领先地位。
不过,相较于采用各种基准测试,英国开源工程师Simon Willison有自己的测试方式,他
先要求Grok 4产生一张鹈鹕骑脚踏车的SVG图档,再请Grok描述该图档,结果Grok便说这
是只类似鸟类的可爱生物在骑脚踏车。
Willison亦批评Grok 4甚至没有提供用来记录开发者、版本、日期、技术与架构等技术细
节,或是模型用途,效能指标,训练资料或是偏误与限制的模型卡。还说在Grok 3本周才
登上新闻版面后,xAI应该要更努力来赢得开发者的信任。
此外,Grok 3才因歧视犹太人引起争议,最新的Grok 4也声称以色列是美国的寄生虫,试
图控制与扼杀美国。惟目前并不确定该回答是否由某些刻意及有心的提示所生成。
Grok 4每100万个Token输入价格为3美元,输出为15美元,与Claude 4 Sonnet相当,但高
于Gemini 2.5 Pro及o3。其订阅方案除了既有的、每月30美元的SuperGrok之外,本周新
增了SuperGrok Heavy,可抢先体验新功能,但每月费用高达300美元。
AI开发者也可透过由Willison建置与负责维护的大型语言模型比价及计价网站来试算模型
费用。
5.完整新闻连结 (或短网址)不可用YAHOO、LINE、MSN等转载媒体:
https://www.ithome.com.tw/news/170016
6.备注:
Grok 4 训练就用了 25万颗NVIDIA的H100 台GG发大财!!!

Links booklink

Contact Us: admin [ a t ] ucptt.com