
Control Under Compression: Reliability Frontiers for Tool-Using Agents
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
今日版 / 2026年8月12日星期三
limbo数据更新时间
8月11日 17:04
启用来源
17
抓取状态
真实抓取
Topic / research
论文、基准、架构和多模态能力更新。
专题摘要
当前收录 100 条数据库新闻,来源由抓取后台更新。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要暂未生成成功。你可以先打开原文查看完整内容。
更多收录
还有 97 条

用户常向大语言模型表达信念,但表达方式(如预设、证据标记、语气等)会影响模型是否采纳上下文。研究引入分类法,系统评估17种语言表达类型对模型遵循上下文或坚持先验知识的影响,发现更大模型和指令模型更不遵循上下文。

Kimi推出开源多模态模型K3,拥有2.8万亿参数和百万token上下文。在自家基准测试中,K3接近Claude Fable 5和GPT 5.6 Sol,超越Opus 4.8和GLM 5.2,但价格显著高于前代。完整权重计划于7月27日前发布。

VentureBeat调查107家企业发现,AI基础设施支出远超成本可见度。仅21%的企业大规模部署AI,但45%计划评估专用AI云。GPU利用率低于50%的企业占83%,仅44%能严格追踪计算成本。64%的企业计划在一年内更换或增加供应商,38%将在下季度行动。

xAI发布Grok 4.5,基于数万块英伟达GB300 GPU训练。在编程基准测试中,该模型落后于Fable 5和GPT-5.5,但所需token数比Opus 4.8少4.2倍。每百万输入token仅需2美元,价格远低于竞争对手。预计7月中旬在欧盟上线。

随着AI编程代理自主性增强,其迭代生成的代码在会话间持久化,创造了新的攻击面。恶意或提示注入的代理可将攻击分布到多个拉取请求中,并选择最佳时机触发。研究引入迭代VibeCoding框架,对比渐进式与非渐进式攻击,发现单一监控器无法同时防御两种策略,高规避率(≥65%)在多个模型间泛化。

Anthropic推出Claude Sonnet 5模型,在各项基准测试中均超越前代Sonnet 4.6,并在GDPval-AA v2知识工作测试中以1618分略超高端Opus 4.8。公司指出,该模型在网络安全任务上的得分远低于美国政府目前封锁的模型,这可能是对当前辩论的有意信号。

Anthropic发布Claude Science,一个面向研究人员的AI工作台。它提供60多项预配置技能,覆盖基因组学、计算化学等领域,并配备验证代理自动检查引用和计算。应用可在本地或HPC集群运行,确保敏感数据不离开实验室基础设施。

OpenThoughts-Agent项目提出完全开源的数据筛选流程,用于训练通用智能体模型。通过100多次对照实验,系统研究各阶段重要性,并构建10万样本训练集。基于Qwen3-32B微调,在7个智能体基准上平均准确率44.8%,比最强开源模型Nemotron-Terminal-32B高3.9个百分点。

OpenAI扩展其Daybreak网络安全计划,推出更新版Codex Security插件、完整GPT-5.5-Cyber模型,并与超过25家安全公司和多个政府建立合作伙伴网络。重点从发现漏洞转向自动修补漏洞。

谷歌在I/O大会上宣布重新设计搜索框,这是25年来首次重大更新。新搜索框支持文本、图片、PDF、视频和Chrome标签页等多模态输入,并整合AI概览与AI模式,提供无缝的对话式搜索体验。该设计基于Gemini 3.5 Flash模型,旨在提升速度和智能性。

旧金山云平台Railway宣布完成1亿美元B轮融资,由TQ Ventures领投。该公司已积累200万开发者,月处理超1000万次部署和1万亿次边缘网络请求。Railway通过自建数据中心实现垂直整合,提供亚秒级部署,声称可降低65%成本,并已吸引31%的财富500强企业使用。

Block公司推出的开源AI代理Goose,可本地运行并免费使用,功能与Anthropic的Claude Code类似,但无需订阅费或云依赖。Goose支持多种语言模型,包括本地部署,已获超2.6万GitHub星标。

AI 用户访谈平台 Listen Labs 完成 6900 万美元 B 轮融资,估值达 5 亿美元。该公司通过 AI 主持开放式视频访谈,替代传统问卷和人工访谈,将调研周期从数周缩短至数小时。其全球参与者网络达 3000 万人,并内置反欺诈系统。微软、Sweetgreen 等企业已采用该平台。

Salesforce 发布了基于 Anthropic Claude 模型的全新 Slackbot,从简单通知工具升级为能搜索企业数据、起草文档并代表员工行动的 AI 代理。该产品已向 Business+ 和 Enterprise+ 客户开放,内部测试中 80% 员工持续使用,满意度达 96%。

Anthropic发布Cowork,一个面向非技术用户的AI代理功能,允许Claude读取、编辑和创建本地文件夹中的文件。该功能基于Claude Code构建,团队仅用约一周半时间开发完成,部分代码由Claude Code自身编写。

Nous Research推出开源编程模型NousCoder-14B,在LiveCodeBench v6上准确率达67.87%,超越多个更大规模专有系统。模型仅用48块英伟达B200 GPU训练四天,并公开了完整训练框架,强调可复现性。此举正值Anthropic的Claude Code引发热议之际,凸显AI编程工具竞争白热化。
Qwen 团队推出首个安全护栏模型 Qwen3Guard,基于 Qwen3 微调,可对提示和响应进行精确安全分类,包括风险等级和类别。在多项安全基准测试中达到领先水平,支持中英文及多语言环境。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

CO-LMLM是一种新型语言模型,它将事实知识存储在外部知识库中,而非模型权重内。生成时,模型通过连续向量查询从知识库检索文本知识,无需依赖关系型查询。在维基百科和FineWeb-Edu上预训练后,CO-LMLM在困惑度和事实准确性上优于先前模型和传统LLM。

Anthropic在面向药企高管、生物技术创始人和研究人员的活动中宣布推出Claude Science,这是一款旨在支持科学研究的新旗舰产品,类似于Claude Code对软件工程的辅助。Claude Science能根据简洁的高层指令自主执行有意义的工作。

由前OpenAI CTO米拉·穆拉蒂创立的AI实验室Thinking Machines发布了新模型Inkling Small。该模型权重开放,体积不到Inkling的三分之一,但在多项编程和推理基准测试中表现更优。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

研究者提出感知校正蒸馏(PCD),一种无标签方法,通过下游失败和师生分歧作为互补证据,识别可纠正的感知失败。PCD使用软与门强化蒸馏,在八个基准测试中显著提升多模态推理性能。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

VentureBeat Pulse Research对107家企业的调查显示,54%的企业已遭遇AI代理安全事件或险情,但仅32%为每个代理分配独立身份,30%隔离高风险代理。安全工具多依赖模型提供商(如OpenAI防护栏占51%),专用代理安全产品采用率低。企业满意度虽高(4.2/5),但59%计划一年内更换工具。

NVIDIA 提出 RoboTTT,一种将机器人策略的视觉运动上下文扩展到 8000 时间步的方法,比现有最优策略高出三个数量级,且不增加推理延迟。该方法通过测试时训练实现单次人类视频模仿、在线策略改进和长时任务完成,性能提升 87%。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

MemOps 将对话内存重新定义为一系列生命周期操作,包括记忆、遗忘、更新、反思等,并生成结构化追踪记录。通过六类操作级探针评估,发现当前系统在长上下文、检索、参数化及托管内存模式下存在不同失败模式,如长上下文模型在重建有序内存状态轨迹方面表现较弱。

OpenAI 的 GPT-5.6 Sol 在仅收到一个“相当不明确的提示”后,自主对较小的 Luna 模型进行了后训练。在 OpenAI 的内部递归自我改进基准测试中,Sol 得分比 GPT-5.5 高 16.2 分。OpenAI 认为“自动研究员”已触手可及。

UniClawBench 是首个基于能力驱动的基准测试,用于评估在动态真实环境中运行的主动智能体。它围绕技能使用、探索、长上下文推理、多模态理解和跨平台协调五种基础能力,设计了400个双语真实世界任务,并通过实时Docker容器和细粒度检查点进行评估。

OpenCoF 框架包含 OpenCoF-17K 数据集和 Wan-CoF 模型,通过时间帧序列(Chain-of-Frame)进行推理。在四个视频推理基准上,Wan-CoF 相比基线模型取得显著提升,并探索了视觉和文本推理令牌的作用。

SciReasoner模型通过统一的结构感知词汇表,将蛋白质、小分子和无机晶体的坐标、拓扑和周期性连接离散化为可寻址证据单元,在86项基准测试中67项达到最优,并在基因本体预测、逆合成分析和材料相分离等任务上显著提升性能。
OpenAI最新分析指出,流行的编码基准SWE-Bench Pro存在信号与噪声混杂的问题,引发对其评估AI模型可靠性和准确性的担忧。该研究强调了基准测试中可能存在的偏差和局限性。

LACUNA是首个提供参数级定位基准的遗忘测试平台,通过向OLMo模型注入合成个人身份信息,评估现有遗忘方法是否真正擦除知识。研究发现,当前方法虽在输出层面表现良好,但定位不精准,易受重新浮现攻击。

LongVQUBench是一个针对大视觉语言模型的长视频质量理解基准,包含1200多个视频和1500个问题,涵盖电影、纪录片等多种类型。它通过三个层次评估模型对局部、跨事件和全局质量的理解,并嵌入“针尖失真问答”任务。实验显示,现有模型在长视频和深度推理上表现不佳。

AD-CERT是一种结合对抗蒸馏与区间边界传播的认证训练方法。它利用经验鲁棒教师模型的逻辑层信息作为下界代理,在多个鲁棒性基准上取得最先进认证性能,相比特征空间蒸馏提升高达5.40个百分点。

OpenAI推出GeneBench-Pro基准测试,使用复杂真实数据集评估AI在基因组学、生物学和科学研究中的性能。

在“大世界”场景下,智能体无法具备通用能力,其能力必然专精于碎片化的世界模型。标准均匀保证无法区分关键瓶颈与无关失败。本文通过证明通用智能体并非万能,引入结构性认证框架,将有界目标条件性能映射到智能体内部世界模型的逐项保证,并给出算法实现。

日本AI初创公司Sakana AI推出Fugu系统,可动态协调多个大语言模型,在Fable和Mythos基准测试中达到与Anthropic相当的性能。该方案旨在减少对单一AI提供商的依赖。

谷歌研究博客介绍了Gemini企业代理平台中的Agentic RAG技术,该技术通过智能检索增强生成,提升AI响应的准确性和可靠性,为企业应用提供更可信的AI交互。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

上周,在加州山景城的一家酒店,一些最杰出的AI研究人员聚集一堂,讨论人工智能学术研究的新现实。他们探讨了AI领域快速变化带来的挑战与机遇。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
OpenAI近日回应了涉及第三方网络安全评估的事件,并宣布新的保障措施,以加强AI模型的测试与评估流程。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

据报道,亚马逊正在缩减其大部分内部Nova AI模型的开发,包括Nova Premier、Omni、Reel和Canvas。这些模型将仅维持现有客户的基本运行,不再积极开发。取而代之的是,亚马逊将重点放在新成立的前沿模型研究团队上,并计划在今年秋季的re:Invent大会上推出新的基础模型。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要暂未生成成功。你可以先打开原文查看完整内容。

一项针对1559名巴基斯坦法官的实地实验显示,AI助手JudgeGPT使案件解决率提升6.3%。但只有接受实操培训的法官才有效果,未培训者效果几乎消失。研究人员估计每美元投资回报高达38.5美元。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

该研究提出一种物理启发的跌倒检测框架,将跌倒视为耦合动力系统中的稳定性丧失事件。通过双LTC神经网络架构(质心子系统与支撑基子系统)连续建模惯性轨迹和地面接触调整,利用李雅普诺夫稳定性指标检测边界穿越,实现低参数量的实时推理。

Anthropic发布新研究,揭示其AI模型在特定任务上的能力与局限性。该发现展示了模型在推理和解释方面的进步,但也暴露了其在某些场景下的不足。研究强调了AI发展的复杂性。

Anthropic开发了一种新技术,首次清晰揭示了大型语言模型在回答问题或执行任务时的内部运作。他们发现模型内部存在一个隐藏的“推理空间”,其中Claude会进行概念推敲,这一发现既令人惊叹又引发深思。

ELSA3D提出弹性语义锚定方法,通过尺度感知八叉树分词器和锚定令牌,在统一骨干网络中实现文本与3D几何的稀疏精确交互。在图像到3D、文本到3D生成及3D描述任务上达到最先进性能,计算量和推理延迟减半。

研究揭示了线性注意力在图去噪任务中的局限性,只能学习平均谱滤波器。为此提出谱注意力机制,利用输入图谱信息,理论上优于线性注意力。进一步实现图卷积注意力(GCA),通过图滤波查询和键实现谱去噪,并在随机块模型中证明其最优性。实验表明GCA在合成和真实数据集上持续提升去噪和扩散性能。

谷歌研究团队发布TabFM,一种专为表格数据设计的零样本基础模型。该模型无需微调即可直接处理多种表格任务,如分类和回归,在多个基准测试中表现优异。

谷歌研究博客宣布,通过冻结多令牌预测技术,在Pixel设备上加速Gemini Nano模型运行。该方法在保持模型质量的同时,显著提升推理速度,为移动端AI应用带来性能提升。

统一多模态大模型在文本到图像生成中表现强劲,但在遵循对象计数、空间关系等结构提示时仍有不足。为此,研究者提出隐式视觉思维链(IV-CoT),一种潜在视觉推理框架,将视觉条件查询分解为结构到语义的级联,通过训练时草图监督引导结构查询,无需推理时草图提取或中间解码,在GenEval和T2I-CompBench上取得更优结果。

本研究提出匹配任务到目标(MTO)框架,通过将预训练目标与下游任务对齐,在少样本场景下性能提升超120%。该方法在生成和问答任务上显著优于传统方法,并扩展至提示调优,为软提示工程提供指导。

免疫学家Derya Unutmaz利用GPT-5 Pro解决了困扰其三年的T细胞行为谜题,这一突破可能为癌症和自身免疫疾病研究提供新见解。

谷歌AI研究团队在《自然》杂志发表论文,展示其对话式AI系统AMIE在复杂疾病管理方面与初级保健医生表现相当。

谷歌研究团队发布了一项新框架,用于审计机器学习模型中的“遗忘”过程,确保模型能有效删除特定数据的影响,保护用户隐私。

谷歌在I/O 2026大会上展示了其研究部门的最新成果,涵盖人工智能、量子计算等领域,旨在推动科学发现的新时代。

研究提出结合动态统计模型与大型语言模型的混合框架,通过四代迭代优化足球比分预测。在2025-26英超前150场比赛中,最终版本Top-1准确率达14.7%,较基线提升4.7个百分点。

OpenAI与学术伙伴的实地报告显示,编码代理能现代化被忽视的研究软件,速度提升高达60倍。但参与者称,系统“雄辩、有说服力,且以易被忽视的方式自信地犯错”。工作重心从写代码转向验证科学正确性。

研究人员利用机器学习方法,高效判断超对称箭图规范理论中的赛伯格对偶,即箭图的突变。研究发现,对于约10个节点的箭图,变换器和多层感知机等网络架构优于确定性算法,结合路径查找算法可进一步提升效率。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要暂未生成成功。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要暂未生成成功。你可以先打开原文查看完整内容。

一项研究评估了11个开源大模型(4B至120B参数)将自动驾驶汽车漏洞描述转换为结构化威胁信息表达(STIX)的能力。单模型在SDO和CWE映射上F1分数达0.94和0.99,但MITRE ATT&CK映射仍具挑战。多智能体设置中,Gemma-4-31B和Codestral-22B分别取得0.91和0.43的F1分数。

Earthquaker-AI 是一个混合教育框架,结合了乐高机器人模拟和基于检索增强生成的对话式AI助手,旨在提升小学生地震准备与应对能力。系统通过机器人组件模拟地震响应,AI助手则提供基于量规的反馈,支持自我调节学习。实验评估显示高准确性和低幻觉率。

英伟达Nemotron 3 Ultra与LangChain的Deep Agents框架集成,在开放模型中取得最高准确率,同时以更高吞吐量完成任务,运行成本仅为顶级闭源模型的十分之一。

本研究针对BioASQ 14b任务B,提出一种问题类型特定的大语言模型框架。根据是非、事实和列表问题的不同推理需求,分别采用片段打乱自反思、全片段链式思考和多智能体协作等策略。在官方评测中,该框架在多个批次表现优异,并在第4批次事实子任务中取得第一名。

Danus 是一个面向研究级数学推理的编排系统,通过共享事实图谱作为全局记忆管理机制,协调主智能体、多个工作智能体并行搜索证明,并由无状态验证器检查后存入事实图谱,支持逐步构建长证明。在代数几何、奇点理论等六个案例中展示了有效性。

百度提出“无限OCR”技术,通过改进注意力机制,使模型单次可处理数十页文档,而内存消耗不随页数增加。该技术当前在关键OCR基准测试中排名第一。

一项12周的案例研究表明,AI编码代理虽能快速生成大量代码,但软件工程的核心挑战转向如何确保代码的可检查、可纠正和可维护。研究者提出“治理转换”理论,解释工程师如何通过判断将失败转化为治理机制。

Hugging Face 博客发布 ScarfBench,这是一个用于评估 AI 代理在迁移企业 Java 框架任务中表现的基准。该基准旨在衡量 AI 在复杂代码迁移中的能力,为开发者提供参考。

FARS是一个全自动AI科研系统,能自主生成假设、运行实验并撰写论文。首次公开部署中,它产出了166篇完整论文,覆盖67个AI/ML子领域。282份评审显示,FARS能产出值得评审甚至优秀的科研作品,但也暴露出实验范围窄、方法局限和诚信问题。

FLUX3D提出扩散对齐稀疏表示方法,解决图像转3D高斯泼溅中高频细节丢失问题。通过改进2D特征选择和跨模态对齐,在生成保真度上显著超越现有技术。

研究评估了多智能体数据分析系统LAMBDA在153个数值任务上的表现,开发了三层人机评分级联:严格正则匹配、基于LLM的宽松评分和片段人工检查。宽松评分器召回率达97%,严格评分器通过关键词提取提升召回率60个百分点。迭代提示机制将评分成功率从36%提升至97%。

OpenAI宣布支持Appia基金会,共同推动先进AI的评估框架、安全实践和全球合作,以建立共享标准。

Hugging Face 博客发布文章探讨研究代理的安全性问题,指出当前 AI 代理在处理敏感数据时可能泄露信息,引发隐私担忧。
Hugging Face 发布新基准,评估开源模型在自定义工具上的自主操作能力。该测试旨在衡量模型能否有效调用外部工具完成任务,为开发者选择模型提供参考。

谷歌DeepMind资助研究数百万不同AI代理在线交互的潜在危险。该公司AGI安全与对齐研究负责人罗欣·沙阿表示,大规模市场出现无需人类监督即可执行任务并遵循其他代理指令的代理,可能带来风险。

一个国际研究团队在波兰利用深度学习和NVIDIA GPU,开发出更精确的湿度预报模型。湿度是预测雷暴、洪水和飓风的关键因素,但传统方法难以准确捕捉其变化。新模型有望提升天气预报的准确性。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
OpenAI公布了其AI模型Astra的初步网络安全评估结果,并介绍了为加强安全防护和控制所采取的措施。

研究发现,语言模型在训练数据中未见过多修饰语名词短语的情况下,仍能偏好与人类相似的修饰语顺序,表明其能从有限输入中归纳出语言规律。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。