最新AI资讯摘要
以下内容由 Super-server 从公开来源整理生成,并保留原始来源链接。完整静态归档位于 /ai-news/。
IT之家
Claude Opus 5发布当天,开发者Eversmile12便将其在claude.ai网页端与移动端的完整系统提示词上传至GitHub,共135027个字符、约3.4万个token、1511行,无一行代码,全部是规则。这份文件实质上由三部分构成:一份列有30个工具及完整JSON schema的产品说明书、一本涵盖版权、儿童安全、危机干预与政治中立的法务合规手册,以及一套内置的自家产品推销机制。其中篇幅最长的章节是跨会话记忆系统me…
Anthropic News
近日,围绕开放权重模型——尤其是来自中国的模型——的争议持续升温。有报道称美国官员正考虑禁止美国企业使用中国开放权重模型,部分声音甚至指责 Anthropic 借机推动封禁以保护自身商业利益。对此,Anthropic CEO 达里奥·阿莫代伊发文澄清:Anthropic 从未主张禁止开放权重模型。他认为,不具备危险能力的开放权重模型是公共产品,能为企业、开发者和研究人员创造价值。阿莫代伊真正担忧的是两类威胁:一是威权政府借助 AI 实…
IT之家
谷歌于7月21日发布三款新AI模型:Gemini 3.6 Flash性能最强且成本更低,Gemini 3.5 Flash Cyber专攻网络安全漏洞发现与修复,Gemini 3.5 Flash-Lite面向AI智能体应用。这些模型旨在平衡效率与性能,价格低于前代,Token消耗减少17%。谷歌同时透露正在预训练Gemini 4,并计划推出旗舰模型Gemini 3.5 Pro。网络安全成为AI竞争新焦点,谷歌将仅向政府机构和可信合作伙伴…
Moonshot AI GitHub
Moonshot AI 在 GitHub 上正式开源 PerceptionBench,这是一个专为评测多模态大语言模型(MLLM)原子视觉感知能力而设计的基准测试框架。与现有侧重高层语义理解或复杂推理的评测集不同,PerceptionBench 将视觉感知能力拆解为更细粒度的原子任务,旨在系统性地衡量模型在颜色识别、空间关系、物体计数、边界检测等基础视觉维度上的真实表现。该项目以 Python 实现,面向学术研究者和模型开发者开放。随…
arXiv LLM/Agent
随着大语言模型与多模态大模型的快速发展,能够主动操作日常工具的智能体逐渐走入真实应用场景。然而,现有评测基准多依赖沙盒环境与单轮交互,且按场景分类的任务体系容易混淆多种能力,难以定位失败根源。为此,研究团队推出 UniClawBench,这是首个以能力驱动的前瞻性智能体评测基准,围绕技能使用、探索、长上下文推理、多模态理解与跨平台协同五项基础能力,设计了 400 个中英双语真实任务。该基准在实时 Docker 容器中以细粒度步骤检查点…
The Decoder
OpenAI 宣布旗下 GPT-5.6 Sol Ultra 模型在不到一小时内,利用 64 个并行子智能体,为悬而未决近五十年的图论难题“循环双重覆盖猜想”生成了完整证明。曼彻斯特大学数学家 Thomas Bloom 认为该证明短小、基础,本可在 1980 年代被发现,关键在于机器不放弃的“坚持”。他同时批评 OpenAI 论文未引用 1983 年 Bermond 等人的相关文献,质疑其究竟是真正创新还是对既有知识的重新组合。该事件再…
IT之家
OpenAI 于 7 月 10 日宣布,GPT-5.6 Sol Ultra 模型在不到 1 小时内生成了循环双覆盖猜想的完整证明。该猜想由数学家 George Szekeres 与 Paul Seymour 分别于 1973 年和 1979 年提出,是图论领域悬而未决的重要难题。模型调用了 64 个并行子智能体,并配合对抗智能体进行漏洞排查。证明将原问题归约为三次图,利用 8-流定理与 GF(3) 有限域上的线性代数完成论证。不过这份…
Anthropic Research
Anthropic前沿红队近日披露,其AI模型Claude Mythos Preview成功发现了两项重要密码学算法弱点。第一项针对后量子数字签名方案HAWK——这是美国国家标准与技术研究院(NIST)后量子密码标准化竞赛的第三轮候选方案,经过两年多轮人类专家审查仍未被攻破。Mythos在约60小时内找到了一种此前未被发现的格对称性,将已知最优攻击效率大幅提升,有效密钥强度减半。第二项针对AES简化版本,攻击速度较此前最优方案提升20…
LangChain
LangChain 团队近日分享了他们如何重构 Deep Agents 的评估框架。由于智能体设计本身充满挑战,评估工作同样困难重重。为此,他们转向以 Harbor 为运行引擎的端到端评测,取代了以往的小型单元测试。Harbor 是一个流行的开源框架,要求提供智能体、数据集和沙箱环境。评估时,每个任务包含环境(Dockerfile)、指令(Markdown)和评估脚本(test.sh),与简单的大语言模型评估不同,智能体评估需要关注运…
arXiv LLM/Agent
随着大语言模型应用越来越多地采用显式工作流来组织工具调用、检索、分支、检查点与人工审批,现有工作流系统在执行层面已较为成熟。该论文提出一种受 Lisp 启发但与具体语言无关的概念模型,借助符号形式、对象标识和活体镜像等思想作为解释视角,而非工程实现细节。论文把工作流定义、实例、推理记录、上下文快照与依赖关系都视为共享知识基底中的持久知识对象。其核心语义区分在于 derive 与 infer:前者是依据已有状态进行的确定性计算,后者是在…
Latent Space
2026年,OpenAI旗下Codex的月活用户数较年初增长逾10倍,ChatGPT Work与Codex合并用户在7月9日上线后不足两周便突破千万。这一增长背后,是一个关键的产品洞察:能使用代码的人群远多于能编写代码的人群,比例约为100比1。OpenAI核心产品工程负责人Akshay Nathan在Latent Space播客中详细阐述了ChatGPT Work的构建思路。他指出,知识工作长期分散于文档、表格、幻灯片等不同工具之间…
inclusionAI GitHub
inclusionAI 在 GitHub 上开源了 AKernel 项目,定位为面向 Agent 的可编程数据中心级基础设施。随着 AI Agent 从单机实验走向大规模生产部署,传统云计算基础设施在调度灵活性、资源隔离与 Agent 生命周期管理等方面逐渐暴露出局限性。AKernel 试图从底层重新定义 Agent 运行环境,以 Python 为主要开发语言,提供可编程接口,使开发者能够在数据中心规模上灵活编排和管理大量并发 Age…
Google AI Blog
Google DeepMind 近日宣布对 Gemini API 托管智能体(Managed Agents)进行全面升级。最新版本将 Gemini 3.6 Flash 设为默认模型,开发者无需修改任何代码即可自动享受更强的推理与编码能力。与此同时,全新的环境钩子(Environment Hooks)机制允许开发者在沙箱内每次工具调用前后插入自定义脚本,实现安全拦截、代码格式化或合规审计等操作。在成本管控方面,新增的预算上限参数可防止复…
OpenBMB GitHub
UltraRAG 是首个基于模型上下文协议(MCP)架构设计的轻量级检索增强生成(RAG)开发框架,面向学术研究与工业原型场景。它将检索、生成等核心模块封装为独立 MCP Server,配合 MCP Client 的工作流编排能力,让开发者仅通过 YAML 配置就能实现条件分支、循环等复杂控制逻辑。2026 年 1 月发布的 3.0 版本强调推理链路透明化,同时配套上线可视化 IDE、Pipeline Builder、知识库管理与一键…
arXiv LLM/Agent
训练后量化是大模型部署中常用的压缩手段,但现有评估几乎完全依赖准确率与困惑度。来自 arXiv 的最新论文提出,量化过程会改变模型的内部行为,即使整体性能看起来保持稳定。研究团队提出“正确性一致率”作为决策层指标,用以衡量基础模型与量化版本在正确预测上的重叠程度。在 8 比特到 2 比特的多种量化方案中,中等压缩即可引发行为分歧。此外,研究者将量化视为注意力权重上的结构算子,量化其逐层畸变,并发现在低位宽下出现非线性断点,查询与键投影…
Latent Space
Black Forest Labs 正式发布 FLUX 3,一个统一的多模态模型,覆盖图像、视频、音频和动作预测。FLUX 3 视频已开放早期访问,其性能在多项基准上超越 Seedance 2.0、Gemini Omni 和 Grok Imagine。同时,团队推出 FLUX-mimic,一个基于 FLUX 3 骨干网络的视频-动作机器人模型,已在真实工厂环境中与 Audi 合作测试。该模型通过联合训练架构实现跨模态能力,并计划发布开…
OpenBMB GitHub
OpenBMB 正式发布 ChatDev 2.0,这是一个基于大语言模型的多智能体协作软件开发平台。该项目在原有 ChatDev 框架基础上进行了全面升级,旨在通过多个具备不同角色的 AI 智能体相互协作,完成从需求分析、代码编写到测试与部署的完整开发流程。ChatDev 2.0 的核心理念是让 LLM 驱动的智能体团队模拟真实软件工程团队的分工协作模式,各智能体承担产品经理、工程师、测试员等不同职责,通过结构化对话与任务分配实现端到…
QwenLM GitHub
Qwen Code 是阿里 QwenLM 团队开源的终端 AI 编程代理,采用 TypeScript 开发,在 GitHub 上获得约 2.59 万星标与 2600 次 Fork,已发布超过 530 个版本。它原生支持 SubAgents、Agent Teams、动态工作流与 MCP,并同时兼容 OpenAI、Anthropic、Gemini、Qwen 等 API 以及 Ollama、vLLM 等本地模型。除交互式终端界面外,还提供…
BAIR
随着AI助手被要求完成越来越复杂的任务,大语言模型的上下文窗口面临无法无限扩展的根本瓶颈。现有的递归摘要(上下文压缩)方案虽能压缩历史信息,但会带来显著的性能损失,在协作代码生成等高质量数据稀缺的领域尤为突出。伯克利人工智能研究团队提出了ABBEL框架,其核心思路是将摘要生成任务独立出来,以自然语言信念状态的形式对摘要内容进行监督。受递归贝叶斯估计启发,模型被周期性地提示根据新观测更新信念状态,并通过信念评分机制对信念内容的质量进行强…
arXiv LLM/Agent
在知识图谱多跳问答任务中,传统“先检索后阅读”的流程难以端到端训练,导致检索器无法跨越中间节点与查询之间缺乏词面重合的语义鸿沟。为此,研究者提出 RSF-GLLM 框架,把图推理与答案生成解耦:循环软流模块借助 GRU 更新查询向量,并通过动态门控沿结构线索传播相关度得分;引入稀疏正则使软概率收敛到离散推理路径,再将路径文本化以微调大模型,确保生成内容贴合图谱事实拓扑。在 WebQSP 与 CWQ 数据集上的实验显示,该方法在效果上具…