首页 > 财税分享 > 财税分享 > 谷歌推出两大数学模型,19秒解开IMO2024几何问题

谷歌推出两大数学模型,19秒解开IMO2024几何问题

发布时间:2024-07-26 22:54:23来源: 15210273549

六道题每题可得7分,总分最高42分。谷歌DeepMind的人工智能系统在今年国际数学奥林匹克竞赛中最终得分28分。今年金牌的门槛是29分,在正式比赛的609名选手中,58名达到了这一门槛。

DeepMind人工智能系统在IMO 2024上相对于人类竞争者的表现。在42分的总分中,人工智能系统获得了28分。

谷歌DeepMind的AI模型解决了今年国际数学奥林匹克竞赛(IMO)六个问题中的四个问题,人工智能首次达到了银牌标准。

当地时间7月25日,谷歌DeepMind公布专用于数学推理的模型AlphaProof,以及专注于几何的模型更新版本AlphaGeometry 2。DeepMind表示,AlphaProof和AlphaGeometry 2解决了数学中的高级推理问题,具有先进数学推理能力的通用人工智能或开启科学和技术的新领域。

IMO是历史最悠久、规模最大、最负盛名的青年数学家竞赛,自1959年以来每年举办一次。选手要解决代数、组合学、几何和数论方面六个异常困难的问题。菲尔兹奖是数学家的最高荣誉之一,菲尔兹奖获得者也会代表他们的国家参加IMO。

近年来,IMO竞赛被认为是机器学习领域的重大挑战,也是衡量人工智能系统高级数学推理能力的理想基准。

谷歌DeepMind表示,IMO的数学问题被人工翻译成数学语言,供系统理解。在正式比赛中,学生们分两次提交答案,每次4.5小时。而人工智能系统在几分钟内解决了一个问题,花了三天时间来解决其他问题。基于强化学习的推理系统AlphaProof解决了两个代数问题和一个数论问题并被证明答案正确,这些问题包括今年IMO比赛中只有5名选手解决的最难的问题。AlphaGeometry 2证明了几何问题,但两个组合问题仍未解决。

六道题每题可得7分,总分最高可达42分。DeepMind的人工智能系统最终得分28分。DeepMind表示,今年金牌的门槛从29分开始,在正式比赛的609名选手中,有58名达到了这个门槛。

“事实上,这个程序能想出这样一个不明显的结构是非常令人印象深刻的,远远超出了我认为的最先进的水平。”IMO金牌得主和菲尔兹奖牌得主蒂莫西·高尔斯(Timothy Gowers)表示。

在大量书面文本上训练的人工智能模型历来在数学推理方面很困难,往往倾向于语言智能而非数学智能,解决数学问题需要更复杂的推理技能。AlphaProof将预先训练好的语言模型与AlphaZero强化学习算法结合在一起,AlphaZero此前自学了如何掌握国际象棋、将棋和围棋。

大语言模型容易产生幻觉,或以令人信服的方式传递错误信息。DeepMind表示,尽管基于自然语言的方法可以访问更多数据,但会产生看似合理但不正确的中间推理步骤和解决方案。而形式语言提供了一个重要优势,即涉及数学推理的证明可以被形式化地验证其正确性。“我们通过微调Gemini模型,在这两个互补的领域之间建立了一座桥梁,自动将自然语言问题语句转换为形式语句,创建了一个不同难度的庞大形式问题库。”

当遇到一个数学问题时,AlphaProof会生成候选解决方案,然后搜索可能的证明步骤来证明或反驳它们。每一个被发现和验证的证明都被用来强化AlphaProof的语言模型,增强其解决后续更具挑战性问题的能力。

财税分享更多>>

领克08 EM-P汽车正式登陆欧洲市场,起售价约人民币40.4万元 广汽丰田“一价到”“一保到底”,威兰达与锋兰达重塑市场价值 测试日产Ariya Nismo——外观运动感强 丰田又添\"爆款\"!2025款RAV4荣放亮相,配TSS智行安全 宝马最畅销车型宝马 X3 迎来大改款 苹果正在内部测试适用于 iPhone 的 iOS 18.3.1 系统版本 3000 元预算的高性价比平板精挑细选 三星Galaxy S25系列手机今日起陆续登陆全球120个国家和地区 同属大众品牌,为何上汽大众品牌略逊于一汽大众? 理想 L6 上市即爆款,它凭什么? 预售价10万-20万元,广汽丰田铂智3X纯电SUV官宣下月上市 解码拼多多“新质供给”:产业带高质量转型的新电商实验 实探 | 楼市新信号!市场期待“小阳春” 有点意思!与三大公司排名完全不,vivo还是Q4第一 2025年荣耀大动作:跨界合作,AI升级 中兴通讯AiCube:高效部署DeepSeek,助力企业抢占AI时代先机 你的人生第一部智能手机是啥,我的是999元的红米手机一代 高管公布魅族海外布局动态 网友称希望新机以全新“ZERO”品牌亮相 别抢Pura 70系列了!华为新旗舰爆料,影像搭配有点炸裂 产品实力不断飙升,OPPO全新折叠屏即将登场!2024稳坐全球TOP4 赛力斯申请“问界伏羲”商标 未来有望推出多款创新车型 喜欢SUV但怕费油,SUV里谁最省油?车主推荐了几款,你喜欢哪款 上班族买车看这!性价比高的家用SUV,实用性还强,值得入手? 谁才是真正的“卷王”?长安UNIZ对比宋DM-i,15万混动SUV大乱斗 华为艾优、未野、小米迷你mini剃须刀怎么样?好不好用?测评揭秘 1.4T帕萨特家用够吗?几位车主给了答案,你同意吗 朋友轩逸开着不错,换开朗逸后,我想了很多 10多万的中大型轿车,续航650km,配FSD悬架,星海S7值得选吗? 北上广热门车型揭晓!特斯拉Model Y夺得冠军 比亚迪腾势N7迎来OTA升级:新增城市领航与车道辅助功能