OpenAI 在 GitHub 发布 372 个 AI 生成的数学证明,呼吁学术界跟上
OpenAI 在 GitHub 发布了 372 个由内部前沿模型生成的数学证明,涵盖对重大计算机算法的改进以及与黎曼猜想相关的进展。每份证明平均消耗约三小时 ChatGPT Pro Thinking 算力,部分附带 Lean 形式化验证。这一发布方式绕过了传统期刊同行评审,引发数学界对 AI 大规模生成定理是否有助于概念理解的争议。
OpenAI 在 GitHub 发布了 372 个由内部前沿模型生成的数学证明,涵盖对重大计算机算法的改进以及与黎曼猜想相关的进展。每份证明平均消耗约三小时 ChatGPT Pro Thinking 算力,部分附带 Lean 形式化验证。这一发布方式绕过了传统期刊同行评审,引发数学界对 AI 大规模生成定理是否有助于概念理解的争议。
OpenAI 发布内部 Navier-Stokes 模型的 722 篇数学论文,解决了 500 个顶级开放数学问题中的 90 个,包括准黎曼猜想等重要成果。每个结果平均只需 3 小时 ChatGPT Pro 推理计算,被 Anthropic 评价为"数学史上最重大时刻"。模型本身尚未开源,成果已公开于 GitHub 仓库。
OpenAI 在 GitHub 上发布了其内部前沿模型在数学开放问题上的研究成果,并公开了 Lean 证明形式化文件和详细研究资料。该成果展示了 AI 模型在解决数学难题方面的能力进展。
Mistral 今日发布 Mistral Large 4 预览版,该模型为1万亿参数、490亿激活参数,训练于3800块 NVIDIA Grace Blackwell GPU集群。
AI 计算提供商 Lambda 计划融资 40 亿美元,投前估值 145 亿美元,为 2027 年 IPO 做准备。订单 backlog 从 6 月的 150 亿美元增至 9 月的 500 亿美元,其中 Anthropic 一家贡献 350 亿美元。
Musubi发布PolicyLM-1.7B,这是一个针对实时内容审核训练的轻量级决策模型,以开放权重形式发布,能在50毫秒内应用普通英语编写的内容政策,且政策变更时无需重新训练。决策模型是AI领域热点,继9月Typesafe AI发布Jev后,OpenAI和Amazon也推出了竞品。Musubi希望借助这一趋势,将决策模型技术应用于内容审核场景。
微软研究院的 Jennifer Neville 在播客访谈中分享了其团队在真实工作场景中评估 AI 系统的研究发现。研究发现,当任务在多次对话轮次中逐步澄清时,模型性能比单轮基准测试时显著下降,用户对此有强烈共鸣。
Mistral 发布 Mistral Large 4,这是公司迄今最大模型,拥有 1 万亿参数、490 亿活跃参数,API 预览已开放,完整权重预计 10 月底发布。该模型主打安全任务处理能力,在 Artificial Analysis Cyber Index 中位列前五,部分优势源于竞品拒绝此类任务。
过去一年OpenAI、Anthropic等实验室在多个长期数学问题上取得突破,甚至解决了千禧年大奖问题之一,但快速推进的方式引发了数学界的反弹。AI实验室表示正在从错误中学习。
AI agent 群体扩展能节省运行时间,但存在"踩脚"效应导致收益递减。Google DeepMind 推出 SynthID Bio,可在合成生物学的氨基酸序列和 3D 结构中嵌入可检测水印,湿实验测试显示不影响蛋白质功能。