刚刚,最后一道FrontierMath Tier 4难题,被GPT-6 Astra攻破了。 至此,这套曾经被视作大模型数学噩梦的研究级测试,所有题目都已经至少被AI成功解出过一次。 Epoch AI也正式给它下了结论,FrontierMath Tier 4,饱和了。
虽然从上面的图里看,Astra还没有直接干到100%,OpenAI自己公布的成绩也是97.6%。 但按照Epoch的算法,“全部解出”指的是把不同模型、不同时间的尝试累积起来以后,Tier 4里的每一道题都已经有过成功解答。 而Astra干掉的,正是此前唯一还没有被AI攻破的那一道。 (简单理解就是Astra可能在某次测试中出错了,但它对的那道题是此前没被解出来的)
有一说一,这个发展速度还是相当离谱的。 |
| |||||||||||||||||||||||||


点击朱笔,直抒胸臆