OpenAI 在 GitHub 发布 372 个 AI 生成的数学证明,呼吁学术界跟上
OpenAI 在 GitHub 发布了 372 个由内部前沿模型生成的数学证明,涵盖对重大计算机算法的改进以及与黎曼猜想相关的进展。每份证明平均消耗约三小时 ChatGPT Pro Thinking 算力,部分附带 Lean 形式化验证。这一发布方式绕过了传统期刊同行评审,引发数学界对 AI 大规模生成定理是否有助于概念理解的争议。
OpenAI 在 GitHub 发布了 372 个由内部前沿模型生成的数学证明,涵盖对重大计算机算法的改进以及与黎曼猜想相关的进展。每份证明平均消耗约三小时 ChatGPT Pro Thinking 算力,部分附带 Lean 形式化验证。这一发布方式绕过了传统期刊同行评审,引发数学界对 AI 大规模生成定理是否有助于概念理解的争议。
OpenAI 发布内部 Navier-Stokes 模型的 722 篇数学论文,解决了 500 个顶级开放数学问题中的 90 个,包括准黎曼猜想等重要成果。每个结果平均只需 3 小时 ChatGPT Pro 推理计算,被 Anthropic 评价为"数学史上最重大时刻"。模型本身尚未开源,成果已公开于 GitHub 仓库。
OpenAI 发布 722 份手稿,包含由未公开前沿模型解答的数百个数学开放问题,涵盖 372 个结果家族。平均每项成果消耗约三小时 ChatGPT Pro 推理算力。数学与人工智能咨询组(AGMAI)监督本次发布,呼吁 AI 实验室通过学术渠道披露模型名称、提示词与算力成本,避免将数学成果用作营销工具。
OpenAI 在 GitHub 上发布了其内部前沿模型在数学开放问题上的研究成果,并公开了 Lean 证明形式化文件和详细研究资料。该成果展示了 AI 模型在解决数学难题方面的能力进展。
Mistral 今日发布 Mistral Large 4 预览版,该模型为1万亿参数、490亿激活参数,训练于3800块 NVIDIA Grace Blackwell GPU集群。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,740M 参数,支持文本、代码、图像、视频和音频统一嵌入。8K token 上下文窗口,可在 Google Pixel 11 Pro 等端侧设备上以约567MB内存运行。代码性能较上一代提升9.92分,支持维度截断节省存储,Apache 2.0 许可,权重已上线 Hugging Face。
推荐理由:Google DeepMind 官方发布端侧多模态嵌入模型,参数仅7.4亿却支持文本/代码/图像/音频/视频统一嵌入,适合本地隐私场景。
Musubi发布PolicyLM-1.7B,这是一个针对实时内容审核训练的轻量级决策模型,以开放权重形式发布,能在50毫秒内应用普通英语编写的内容政策,且政策变更时无需重新训练。决策模型是AI领域热点,继9月Typesafe AI发布Jev后,OpenAI和Amazon也推出了竞品。Musubi希望借助这一趋势,将决策模型技术应用于内容审核场景。
Google 发布 Nano Banana 2.1 图像生成模型,价格相比上一代约减半,1K 图像从 6.70 美分降至 3.36 美分,4K 图像从 15.10 美分降至 7.56 美分。该模型基于 Gemini 3.6 Flash,在视觉质量、文字渲染、角色一致性等方面有全面提升,已接入 Google Search、Gemini App、AI Studio 等产品。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,740M 参数即可在浏览器本地运行,在多项评测中超越两倍体量的竞品模型,代码嵌入基准 MTEB 提升近 10 分至 78.68。模型仅需 191MB 内存,配合 Gemma 4 等小模型可实现离线 RAG 应用,权重已在 Hugging Face 和 Kaggle 开放。
Mistral 发布 Mistral Large 4,这是公司迄今最大模型,拥有 1 万亿参数、490 亿活跃参数,API 预览已开放,完整权重预计 10 月底发布。该模型主打安全任务处理能力,在 Artificial Analysis Cyber Index 中位列前五,部分优势源于竞品拒绝此类任务。
法国 AI 实验室 Mistral AI 发布 Mistral Large 4(昵称 Le Chonk),这是一款 1T 参数的多模态大模型,计划在三周安全测试后开源权重。
Mistral AI 发布 Mistral Large 4 预览版,该模型为万亿参数多模态大模型,本月将开源权重。其在网络安全、编码、智能体工作流与多模态理解基准上达到开放模型领先水平,部分视觉定位能力超越闭源前沿模型。模型基于 3800 张 NVIDIA Grace Blackwell GPU 在欧洲本土训练,支持 160 多种语言,已开放 API 试用并作为下一代专用模型的基础。
推荐理由:原文给出性能基准与开源计划,读者可评估其在安全、编码与多模态任务上的实际竞争力。
电信运营商正将AI战略建立在开放模型之上,因其能提供信任、控制和定制化能力,89%的受访者认为开源模型对其AI战略重要。NVIDIA报告指出,开放模型可降低前沿智能成本,支持电信专用微调;独立基准测试显示领先开放模型在复杂任务上更具竞争力。SoftBank、AT&T等运营商已利用NVIDIA Nemotron等模型开发电信业务专用AI。
Reflection发布开源模型Beam,以5010亿总参数中仅激活230亿的方式大幅降低算力成本,主打代码与智能体任务,直接对标DeepSeek与Qwen。该模型经超大规模强化学习训练,支持可调推理深度并展现涌现的联网浏览能力,权重与评估方法将于本月开放。
Hugging Face 发布 Falcon-Emirati-7B,这是基于 Falcon-H1-Arabic 构建的阿联酋方言专用模型。该 7B 参数模型采用 Mamba 与 Transformer 混合架构,支持最高 256K tokens 上下文窗口,通过真实方言网络数据、阿联酋文化 MSAs 数据及受约束的合成数据进行训练,目标使模型能以母语使用者方式理解和生成阿联酋阿拉伯语。
德国公司 Aleph Alpha 发布开源模型 Kolibri,780 亿参数,MoE 架构每次 token 激活约 30 亿参数,支持 100 万 token 上下文窗口,在 Hugging Face 以 Apache 2.0 开源。德语占训练数据 21.3%,模型由 768 块 B200 GPU 在德国和芬兰训练,德语基准得分 71%,目标客户为公共行政、航空和工业领域。