跳到正文
今天10月7日周三4 条
  1. Google DeepMind67

    Google DeepMind 发布开源端侧多模态嵌入模型 EmbeddingGemma 2

    Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,740M 参数,支持文本、代码、图像、视频和音频统一嵌入。8K token 上下文窗口,可在 Google Pixel 11 Pro 等端侧设备上以约567MB内存运行。代码性能较上一代提升9.92分,支持维度截断节省存储,Apache 2.0 许可,权重已上线 Hugging Face。

    推荐理由:Google DeepMind 官方发布端侧多模态嵌入模型,参数仅7.4亿却支持文本/代码/图像/音频/视频统一嵌入,适合本地隐私场景。

  2. The Decoder59

    Google 发布 EmbeddingGemma 2:740M 参数多模态嵌入模型,本地运行可替代数倍体量竞品

    Google 发布开源多模态嵌入模型 EmbeddingGemma 2,740M 参数即可在浏览器本地运行,在多项评测中超越两倍体量的竞品模型,代码嵌入基准 MTEB 提升近 10 分至 78.68。模型仅需 191MB 内存,配合 Gemma 4 等小模型可实现离线 RAG 应用,权重已在 Hugging Face 和 Kaggle 开放。

10月6日周二
  1. Simon Willison31

    Claude Opus 5.5 能否创作游戏音乐

    作者尝试让 Claude Opus 5.5 创作类似《猴岛的秘密》风格的游戏音乐。模型采用自定义文本格式生成音轨,配合播放工具输出音频,结果出乎意料地好。作者认为这可能是文本模型近期新出现的能力,但仍需与其他模型对比实验来确认。

  2. Mistral AI64

    Mistral Large 4 发布

    Mistral AI 发布 Mistral Large 4 预览版,该模型为万亿参数多模态大模型,本月将开源权重。其在网络安全、编码、智能体工作流与多模态理解基准上达到开放模型领先水平,部分视觉定位能力超越闭源前沿模型。模型基于 3800 张 NVIDIA Grace Blackwell GPU 在欧洲本土训练,支持 160 多种语言,已开放 API 试用并作为下一代专用模型的基础。

    推荐理由:原文给出性能基准与开源计划,读者可评估其在安全、编码与多模态任务上的实际竞争力。

  3. The Decoder62

    OpenAI 将在欧盟为 ChatGPT 添加水印,但全球 API 用户可选择关闭

    OpenAI 宣布将在欧盟 ChatGPT 文本中使用 textGrain 技术添加隐形水印以满足欧盟 AI 法案要求,但全球 API 用户可选择关闭此功能。与 Anthropic 对 Claude 实行全球强制水印不同,OpenAI 的策略更为灵活,文章还提供了具体的检测率数据:400-token 心理学科段落约 94%,数学段落约 60%,且编辑文本会显著降低检测率。

10月5日周一
  1. Ars Technica · AI49

    AI眼镜面临首次重大政府监管打击

    澳大利亚正在考虑在特定公共场所禁止智能眼镜,挪威政府已将相关禁令列为"最高优先级"并计划提交草案。隐私担忧促使部分活动人士将智能眼镜称为"变态技术",而Meta、Google和OpenAI等公司仍看好其作为AI入口的潜力,Counterpoint Research预估2026至2032年间消费者可穿戴设备支出将超1万亿美元。

  2. The Decoder47

    ChatGPT 图像生成加载页推出新产品轮播广告

    ChatGPT 即将在美国用户生成图像时展示产品轮播广告,广告标注为广告内容并显示在生成图像下方。OpenAI 本月启动测试,首批广告主可设置否定关键词并选择品牌安全过滤。ChatGPT 广告业务自今年2月推出后已覆盖40余国,年化广告收入达10亿美元,目标是2030年广告收入达1000亿美元。