OpenAI 发布 722 篇数学论文,解决 500 个顶级开放问题中的 90 个
OpenAI 发布内部 Navier-Stokes 模型的 722 篇数学论文,解决了 500 个顶级开放数学问题中的 90 个,包括准黎曼猜想等重要成果。每个结果平均只需 3 小时 ChatGPT Pro 推理计算,被 Anthropic 评价为"数学史上最重大时刻"。模型本身尚未开源,成果已公开于 GitHub 仓库。
OpenAI 发布内部 Navier-Stokes 模型的 722 篇数学论文,解决了 500 个顶级开放数学问题中的 90 个,包括准黎曼猜想等重要成果。每个结果平均只需 3 小时 ChatGPT Pro 推理计算,被 Anthropic 评价为"数学史上最重大时刻"。模型本身尚未开源,成果已公开于 GitHub 仓库。
Mistral AI 发布 Mistral Large 4 预览版,该模型为万亿参数多模态大模型,本月将开源权重。其在网络安全、编码、智能体工作流与多模态理解基准上达到开放模型领先水平,部分视觉定位能力超越闭源前沿模型。模型基于 3800 张 NVIDIA Grace Blackwell GPU 在欧洲本土训练,支持 160 多种语言,已开放 API 试用并作为下一代专用模型的基础。
推荐理由:原文给出性能基准与开源计划,读者可评估其在安全、编码与多模态任务上的实际竞争力。
Reflection发布开源模型Beam,以5010亿总参数中仅激活230亿的方式大幅降低算力成本,主打代码与智能体任务,直接对标DeepSeek与Qwen。该模型经超大规模强化学习训练,支持可调推理深度并展现涌现的联网浏览能力,权重与评估方法将于本月开放。
Google研究者提出RRSI(正则化递归自改进智能体框架),通过在两个环节约束自优化过程——限制单次编辑预算并随时间缩小,以及由critic过滤掉硬编码任务名的修改——防止智能体在反复优化同一组测试任务时产生记忆。
在 AWS GovCloud (US) 的 Amazon Bedrock 上部署 Claude Opus 5.5 和 Claude Sonnet 5.5,支持 ITAR 等受监管工作负载的 AI 辅助开发。
HackerRank 宣布其 AI 面试官 Chakra 正式面向客户开放。产品上线前已完成超过 50 万次测试面试,参与测试的公司包括 Snowflake、Snorkel 和 Capgemini。