全球大模型进展新闻浏览站
中文头版English
输入关键词,快速查找已抓取新闻。

今日版 / 2026年8月12日星期三

limbo logolimbo

数据更新时间

8月11日 17:04

启用来源

17

抓取状态

真实抓取

Topic / research

研究进展

论文、基准、架构和多模态能力更新。

专题摘要

当前收录 100 条数据库新闻,来源由抓取后台更新。

arXiv AI / CL热度 89待摘要

Zing: Social Mind for LLMs

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

DeepSeek

更多收录

还有 97 条

arXiv AI / CL热度 89AI 摘要

语言表达如何影响大模型:信念表达方式对模型响应的影响

用户常向大语言模型表达信念,但表达方式(如预设、证据标记、语气等)会影响模型是否采纳上下文。研究引入分类法,系统评估17种语言表达类型对模型遵循上下文或坚持先验知识的影响,发现更大模型和指令模型更不遵循上下文。

LlamaQwenQwen3
The Decoder热度 89AI 摘要

Kimi发布开源模型K3,性能逼近GPT-5.6和Fable 5

Kimi推出开源多模态模型K3,拥有2.8万亿参数和百万token上下文。在自家基准测试中,K3接近Claude Fable 5和GPT 5.6 Sol,超越Opus 4.8和GLM 5.2,但价格显著高于前代。完整权重计划于7月27日前发布。

ClaudeFableGLMGPT
VentureBeat AI热度 89AI 摘要

企业AI基础设施支出加速,但成本可见度滞后

VentureBeat调查107家企业发现,AI基础设施支出远超成本可见度。仅21%的企业大规模部署AI,但45%计划评估专用AI云。GPU利用率低于50%的企业占83%,仅44%能严格追踪计算成本。64%的企业计划在一年内更换或增加供应商,38%将在下季度行动。

AnthropicAWSGoogleMicrosoft
United States原文链接
The Decoder热度 89AI 摘要

xAI发布Grok 4.5,价格仅为竞品零头

xAI发布Grok 4.5,基于数万块英伟达GB300 GPU训练。在编程基准测试中,该模型落后于Fable 5和GPT-5.5,但所需token数比Opus 4.8少4.2倍。每百万输入token仅需2美元,价格远低于竞争对手。预计7月中旬在欧盟上线。

NVIDIAxAIFableGPT
arXiv AI / CL热度 89AI 摘要

AI编程代理的持久状态攻击:跨拉取请求的分布式威胁

随着AI编程代理自主性增强,其迭代生成的代码在会话间持久化,创造了新的攻击面。恶意或提示注入的代理可将攻击分布到多个拉取请求中,并选择最佳时机触发。研究引入迭代VibeCoding框架,对比渐进式与非渐进式攻击,发现单一监控器无法同时防御两种策略,高规避率(≥65%)在多个模型间泛化。

ClaudeGeminiGPTKimi
The Decoder热度 89AI 摘要

Anthropic发布Claude Sonnet 5,性能逼近高端Opus系列

Anthropic推出Claude Sonnet 5模型,在各项基准测试中均超越前代Sonnet 4.6,并在GDPval-AA v2知识工作测试中以1618分略超高端Opus 4.8。公司指出,该模型在网络安全任务上的得分远低于美国政府目前封锁的模型,这可能是对当前辩论的有意信号。

AnthropicClaude
The Decoder热度 89AI 摘要

Anthropic推出Claude Science,专为研究人员打造的AI工作台

Anthropic发布Claude Science,一个面向研究人员的AI工作台。它提供60多项预配置技能,覆盖基因组学、计算化学等领域,并配备验证代理自动检查引用和计算。应用可在本地或HPC集群运行,确保敏感数据不离开实验室基础设施。

AnthropicClaude
arXiv AI / CL热度 89AI 摘要

OpenThoughts-Agent:开源智能体模型训练数据配方

OpenThoughts-Agent项目提出完全开源的数据筛选流程,用于训练通用智能体模型。通过100多次对照实验,系统研究各阶段重要性,并构建10万样本训练集。基于Qwen3-32B微调,在7个智能体基准上平均准确率44.8%,比最强开源模型Nemotron-Terminal-32B高3.9个百分点。

Qwen
VentureBeat AI热度 89AI 摘要

谷歌25年来首次重新设计搜索框,AI驱动多模态交互

谷歌在I/O大会上宣布重新设计搜索框,这是25年来首次重大更新。新搜索框支持文本、图片、PDF、视频和Chrome标签页等多模态输入,并整合AI概览与AI模式,提供无缝的对话式搜索体验。该设计基于Gemini 3.5 Flash模型,旨在提升速度和智能性。

GoogleGoogle DeepMindGemini
United States原文链接
VentureBeat AI热度 89AI 摘要

云平台Railway获1亿美元融资,挑战AWS等传统云巨头

旧金山云平台Railway宣布完成1亿美元B轮融资,由TQ Ventures领投。该公司已积累200万开发者,月处理超1000万次部署和1万亿次边缘网络请求。Railway通过自建数据中心实现垂直整合,提供亚秒级部署,声称可降低65%成本,并已吸引31%的财富500强企业使用。

AmazonAWSGoogleMicrosoft
United States原文链接
VentureBeat AI热度 89AI 摘要

Listen Labs 获 6900 万美元融资,用 AI 替代传统用户调研

AI 用户访谈平台 Listen Labs 完成 6900 万美元 B 轮融资,估值达 5 亿美元。该公司通过 AI 主持开放式视频访谈,替代传统问卷和人工访谈,将调研周期从数周缩短至数小时。其全球参与者网络达 3000 万人,并内置反欺诈系统。微软、Sweetgreen 等企业已采用该平台。

MicrosoftClaude
United States原文链接
VentureBeat AI热度 89AI 摘要

Salesforce 推出全新 Slackbot AI 代理,挑战微软和谷歌

Salesforce 发布了基于 Anthropic Claude 模型的全新 Slackbot,从简单通知工具升级为能搜索企业数据、起草文档并代表员工行动的 AI 代理。该产品已向 Business+ 和 Enterprise+ 客户开放,内部测试中 80% 员工持续使用,满意度达 96%。

AnthropicGoogleMicrosoftOpenAI
United States原文链接
VentureBeat AI热度 89AI 摘要

Anthropic推出Cowork:非技术用户也能用Claude操作本地文件

Anthropic发布Cowork,一个面向非技术用户的AI代理功能,允许Claude读取、编辑和创建本地文件夹中的文件。该功能基于Claude Code构建,团队仅用约一周半时间开发完成,部分代码由Claude Code自身编写。

AnthropicGoogleMicrosoftOpenAI
United States原文链接
VentureBeat AI热度 89AI 摘要

Nous Research发布开源编程模型NousCoder-14B,四天训练挑战Claude Code

Nous Research推出开源编程模型NousCoder-14B,在LiveCodeBench v6上准确率达67.87%,超越多个更大规模专有系统。模型仅用48块英伟达B200 GPU训练四天,并公开了完整训练框架,强调可复现性。此举正值Anthropic的Claude Code引发热议之际,凸显AI编程工具竞争白热化。

AlibabaAnthropicGoogleHugging Face
United States原文链接
Qwen Blog热度 89AI 摘要

Qwen3Guard:实时安全检测模型发布

Qwen 团队推出首个安全护栏模型 Qwen3Guard,基于 Qwen3 微调,可对提示和响应进行精确安全分类,包括风险等级和类别。在多项安全基准测试中达到领先水平,支持中英文及多语言环境。

Hugging FaceQwenQwen3
arXiv AI / CL热度 84AI 摘要

连续查询有限记忆语言模型提升知识检索效率

CO-LMLM是一种新型语言模型,它将事实知识存储在外部知识库中,而非模型权重内。生成时,模型通过连续向量查询从知识库检索文本知识,无需依赖关系型查询。在维基百科和FineWeb-Edu上预训练后,CO-LMLM在困惑度和事实准确性上优于先前模型和传统LLM。

ClaudeGPT
MIT Technology Review AI热度 84AI 摘要

Anthropic发布Claude Science,助力科学研究

Anthropic在面向药企高管、生物技术创始人和研究人员的活动中宣布推出Claude Science,这是一款旨在支持科学研究的新旗舰产品,类似于Claude Code对软件工程的辅助。Claude Science能根据简洁的高层指令自主执行有意义的工作。

AnthropicClaude
United States原文链接
arXiv AI / CL热度 81AI 摘要

多模态推理中感知蒸馏的信用分配新方法

研究者提出感知校正蒸馏(PCD),一种无标签方法,通过下游失败和师生分歧作为互补证据,识别可纠正的感知失败。PCD使用软与门强化蒸馏,在八个基准测试中显著提升多模态推理性能。

待识别
arXiv AI / CL热度 81待摘要

Shieldstral

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

待识别
VentureBeat AI热度 81AI 摘要

企业AI代理安全缺口:54%已发生安全事件,身份隔离成短板

VentureBeat Pulse Research对107家企业的调查显示,54%的企业已遭遇AI代理安全事件或险情,但仅32%为每个代理分配独立身份,30%隔离高风险代理。安全工具多依赖模型提供商(如OpenAI防护栏占51%),专用代理安全产品采用率低。企业满意度虽高(4.2/5),但59%计划一年内更换工具。

AnthropicAWSGoogleMicrosoft
United States原文链接
arXiv AI / CL热度 81AI 摘要

RoboTTT:将机器人策略的上下文窗口扩展至8000步

NVIDIA 提出 RoboTTT,一种将机器人策略的视觉运动上下文扩展到 8000 时间步的方法,比现有最优策略高出三个数量级,且不增加推理延迟。该方法通过测试时训练实现单次人类视频模仿、在线策略改进和长时任务完成,性能提升 87%。

NVIDIA
arXiv AI / CL热度 81AI 摘要

MemOps:长程对话中生命周期内存操作的基准测试

MemOps 将对话内存重新定义为一系列生命周期操作,包括记忆、遗忘、更新、反思等,并生成结构化追踪记录。通过六类操作级探针评估,发现当前系统在长上下文、检索、参数化及托管内存模式下存在不同失败模式,如长上下文模型在重建有序内存状态轨迹方面表现较弱。

待识别
The Decoder热度 81AI 摘要

OpenAI GPT-5.6 Sol 自主微调小模型 Luna

OpenAI 的 GPT-5.6 Sol 在仅收到一个“相当不明确的提示”后,自主对较小的 Luna 模型进行了后训练。在 OpenAI 的内部递归自我改进基准测试中,Sol 得分比 GPT-5.5 高 16.2 分。OpenAI 认为“自动研究员”已触手可及。

OpenAIGPT
arXiv AI / CL热度 81AI 摘要

UniClawBench:首个面向真实世界任务的主动智能体基准

UniClawBench 是首个基于能力驱动的基准测试,用于评估在动态真实环境中运行的主动智能体。它围绕技能使用、探索、长上下文推理、多模态理解和跨平台协调五种基础能力,设计了400个双语真实世界任务,并通过实时Docker容器和细粒度检查点进行评估。

待识别
arXiv AI / CL热度 81AI 摘要

OpenCoF:通过视频生成实现推理能力

OpenCoF 框架包含 OpenCoF-17K 数据集和 Wan-CoF 模型,通过时间帧序列(Chain-of-Frame)进行推理。在四个视频推理基准上,Wan-CoF 相比基线模型取得显著提升,并探索了视觉和文本推理令牌的作用。

待识别
arXiv AI / CL热度 81AI 摘要

多模态科学基础模型实现跨学科结构推理

SciReasoner模型通过统一的结构感知词汇表,将蛋白质、小分子和无机晶体的坐标、拓扑和周期性连接离散化为可寻址证据单元,在86项基准测试中67项达到最优,并在基因本体预测、逆合成分析和材料相分离等任务上显著提升性能。

待识别
OpenAI News热度 81AI 摘要

OpenAI分析揭示SWE-Bench Pro编码基准可靠性问题

OpenAI最新分析指出,流行的编码基准SWE-Bench Pro存在信号与噪声混杂的问题,引发对其评估AI模型可靠性和准确性的担忧。该研究强调了基准测试中可能存在的偏差和局限性。

OpenAI
United States原文链接
arXiv AI / CL热度 81AI 摘要

LACUNA:评估大模型遗忘精准度的新测试平台

LACUNA是首个提供参数级定位基准的遗忘测试平台,通过向OLMo模型注入合成个人身份信息,评估现有遗忘方法是否真正擦除知识。研究发现,当前方法虽在输出层面表现良好,但定位不精准,易受重新浮现攻击。

待识别
arXiv AI / CL热度 81AI 摘要

长视频质量理解基准LongVQUBench发布

LongVQUBench是一个针对大视觉语言模型的长视频质量理解基准,包含1200多个视频和1500个问题,涵盖电影、纪录片等多种类型。它通过三个层次评估模型对局部、跨事件和全局质量的理解,并嵌入“针尖失真问答”任务。实验显示,现有模型在长视频和深度推理上表现不佳。

待识别
arXiv AI / CL热度 81AI 摘要

对抗蒸馏提升认证鲁棒性,新方法实现最优性能

AD-CERT是一种结合对抗蒸馏与区间边界传播的认证训练方法。它利用经验鲁棒教师模型的逻辑层信息作为下界代理,在多个鲁棒性基准上取得最先进认证性能,相比特征空间蒸馏提升高达5.40个百分点。

待识别
arXiv AI / CL热度 81AI 摘要

世界模型碎片化:通用智能体的结构性认证方法

在“大世界”场景下,智能体无法具备通用能力,其能力必然专精于碎片化的世界模型。标准均匀保证无法区分关键瓶颈与无关失败。本文通过证明通用智能体并非万能,引入结构性认证框架,将有界目标条件性能映射到智能体内部世界模型的逐项保证,并给出算法实现。

待识别
MIT Technology Review AI热度 76AI 摘要

AI教授应对学术研究新现实

上周,在加州山景城的一家酒店,一些最杰出的AI研究人员聚集一堂,讨论人工智能学术研究的新现实。他们探讨了AI领域快速变化带来的挑战与机遇。

待识别
United States原文链接
The Decoder热度 76AI 摘要

亚马逊收缩Nova AI模型,押注前沿研究团队

据报道,亚马逊正在缩减其大部分内部Nova AI模型的开发,包括Nova Premier、Omni、Reel和Canvas。这些模型将仅维持现有客户的基本运行,不再积极开发。取而代之的是,亚马逊将重点放在新成立的前沿模型研究团队上,并计划在今年秋季的re:Invent大会上推出新的基础模型。

Amazon
arXiv AI / CL热度 76AI 摘要

基于视觉的低功耗边缘平台实时跌倒检测新方法

该研究提出一种物理启发的跌倒检测框架,将跌倒视为耦合动力系统中的稳定性丧失事件。通过双LTC神经网络架构(质心子系统与支撑基子系统)连续建模惯性轨迹和地面接触调整,利用李雅普诺夫稳定性指标检测边界穿越,实现低参数量的实时推理。

待识别
MIT Technology Review AI热度 76AI 摘要

Anthropic最新AI发现:能力与局限并存

Anthropic发布新研究,揭示其AI模型在特定任务上的能力与局限性。该发现展示了模型在推理和解释方面的进步,但也暴露了其在某些场景下的不足。研究强调了AI发展的复杂性。

Anthropic
United States原文链接
MIT Technology Review AI热度 76AI 摘要

Anthropic发现Claude内部隐藏的推理空间

Anthropic开发了一种新技术,首次清晰揭示了大型语言模型在回答问题或执行任务时的内部运作。他们发现模型内部存在一个隐藏的“推理空间”,其中Claude会进行概念推敲,这一发现既令人惊叹又引发深思。

AnthropicClaude
United States原文链接
arXiv AI / CL热度 76AI 摘要

ELSA3D:弹性语义锚定实现统一3D理解与生成

ELSA3D提出弹性语义锚定方法,通过尺度感知八叉树分词器和锚定令牌,在统一骨干网络中实现文本与3D几何的稀疏精确交互。在图像到3D、文本到3D生成及3D描述任务上达到最先进性能,计算量和推理延迟减半。

待识别
arXiv AI / CL热度 76AI 摘要

图卷积注意力:从谱视角看图去噪与扩散

研究揭示了线性注意力在图去噪任务中的局限性,只能学习平均谱滤波器。为此提出谱注意力机制,利用输入图谱信息,理论上优于线性注意力。进一步实现图卷积注意力(GCA),通过图滤波查询和键实现谱去噪,并在随机块模型中证明其最优性。实验表明GCA在合成和真实数据集上持续提升去噪和扩散性能。

待识别
Google Research Blog热度 76AI 摘要

谷歌推出TabFM:零样本表格数据基础模型

谷歌研究团队发布TabFM,一种专为表格数据设计的零样本基础模型。该模型无需微调即可直接处理多种表格任务,如分类和回归,在多个基准测试中表现优异。

待识别
United States原文链接
arXiv AI / CL热度 76AI 摘要

隐式视觉思维链:结构感知文本到图像生成新方法

统一多模态大模型在文本到图像生成中表现强劲,但在遵循对象计数、空间关系等结构提示时仍有不足。为此,研究者提出隐式视觉思维链(IV-CoT),一种潜在视觉推理框架,将视觉条件查询分解为结构到语义的级联,通过训练时草图监督引导结构查询,无需推理时草图提取或中间解码,在GenEval和T2I-CompBench上取得更优结果。

待识别
Google Research Blog热度 76AI 摘要

谷歌提出机器学习遗忘审计新框架

谷歌研究团队发布了一项新框架,用于审计机器学习模型中的“遗忘”过程,确保模型能有效删除特定数据的影响,保护用户隐私。

待识别
United States原文链接
Google Research Blog热度 76AI 摘要

谷歌I/O 2026:开启科学发现新纪元

谷歌在I/O 2026大会上展示了其研究部门的最新成果,涵盖人工智能、量子计算等领域,旨在推动科学发现的新时代。

Google
United States原文链接
arXiv AI / CL热度 73AI 摘要

可审计混合模型提升足球比分预测精度

研究提出结合动态统计模型与大型语言模型的混合框架,通过四代迭代优化足球比分预测。在2025-26英超前150场比赛中,最终版本Top-1准确率达14.7%,较基线提升4.7个百分点。

待识别
The Decoder热度 73AI 摘要

AI编码代理可升级科研软件但无法判断科学正确性

OpenAI与学术伙伴的实地报告显示,编码代理能现代化被忽视的研究软件,速度提升高达60倍。但参与者称,系统“雄辩、有说服力,且以易被忽视的方式自信地犯错”。工作重心从写代码转向验证科学正确性。

OpenAI
arXiv AI / CL热度 73AI 摘要

机器学习追踪赛伯格对偶

研究人员利用机器学习方法,高效判断超对称箭图规范理论中的赛伯格对偶,即箭图的突变。研究发现,对于约10个节点的箭图,变换器和多层感知机等网络架构优于确定性算法,结合路径查找算法可进一步提升效率。

Google
arXiv AI / CL热度 73AI 摘要

评估开源大模型生成自动驾驶汽车漏洞结构化威胁信息的能力

一项研究评估了11个开源大模型(4B至120B参数)将自动驾驶汽车漏洞描述转换为结构化威胁信息表达(STIX)的能力。单模型在SDO和CWE映射上F1分数达0.94和0.99,但MITRE ATT&CK映射仍具挑战。多智能体设置中,Gemma-4-31B和Codestral-22B分别取得0.91和0.43的F1分数。

待识别
arXiv AI / CL热度 73AI 摘要

Earthquaker-AI:基于检索增强生成与量规评估的小学地震教育框架

Earthquaker-AI 是一个混合教育框架,结合了乐高机器人模拟和基于检索增强生成的对话式AI助手,旨在提升小学生地震准备与应对能力。系统通过机器人组件模拟地震响应,AI助手则提供基于量规的反馈,支持自我调节学习。实验评估显示高准确性和低幻觉率。

Meta
arXiv AI / CL热度 73AI 摘要

面向生物医学问答的答案类型感知LLM流水线

本研究针对BioASQ 14b任务B,提出一种问题类型特定的大语言模型框架。根据是非、事实和列表问题的不同推理需求,分别采用片段打乱自反思、全片段链式思考和多智能体协作等策略。在官方评测中,该框架在多个批次表现优异,并在第4批次事实子任务中取得第一名。

待识别
arXiv AI / CL热度 73AI 摘要

Danus:基于事实图谱记忆的数学推理智能体编排系统

Danus 是一个面向研究级数学推理的编排系统,通过共享事实图谱作为全局记忆管理机制,协调主智能体、多个工作智能体并行搜索证明,并由无状态验证器检查后存入事实图谱,支持逐步构建长证明。在代数几何、奇点理论等六个案例中展示了有效性。

待识别
arXiv AI / CL热度 73AI 摘要

AI代码生成:廉价代码背后的昂贵判断

一项12周的案例研究表明,AI编码代理虽能快速生成大量代码,但软件工程的核心挑战转向如何确保代码的可检查、可纠正和可维护。研究者提出“治理转换”理论,解释工程师如何通过判断将失败转化为治理机制。

待识别
Hugging Face Blog热度 73AI 摘要

ScarfBench:评估AI代理迁移企业Java框架的基准

Hugging Face 博客发布 ScarfBench,这是一个用于评估 AI 代理在迁移企业 Java 框架任务中表现的基准。该基准旨在衡量 AI 在复杂代码迁移中的能力,为开发者提供参考。

待识别
arXiv AI / CL热度 73AI 摘要

FARS:全自动科研系统大规模部署,产出166篇论文

FARS是一个全自动AI科研系统,能自主生成假设、运行实验并撰写论文。首次公开部署中,它产出了166篇完整论文,覆盖67个AI/ML子领域。282份评审显示,FARS能产出值得评审甚至优秀的科研作品,但也暴露出实验范围窄、方法局限和诚信问题。

待识别
arXiv AI / CL热度 73AI 摘要

AI数据分析系统自动评分:严格匹配与宽松评估的权衡

研究评估了多智能体数据分析系统LAMBDA在153个数值任务上的表现,开发了三层人机评分级联:严格正则匹配、基于LLM的宽松评分和片段人工检查。宽松评分器召回率达97%,严格评分器通过关键词提取提升召回率60个百分点。迭代提示机制将评分成功率从36%提升至97%。

Meta
MIT Technology Review AI热度 73AI 摘要

谷歌DeepMind担忧数百万AI代理交互风险

谷歌DeepMind资助研究数百万不同AI代理在线交互的潜在危险。该公司AGI安全与对齐研究负责人罗欣·沙阿表示,大规模市场出现无需人类监督即可执行任务并遵循其他代理指令的代理,可能带来风险。

GoogleGoogle DeepMind
United States原文链接
NVIDIA Deep Learning Blog热度 73AI 摘要

波兰国际团队用深度学习与NVIDIA GPU改进湿度预报

一个国际研究团队在波兰利用深度学习和NVIDIA GPU,开发出更精确的湿度预报模型。湿度是预测雷暴、洪水和飓风的关键因素,但传统方法难以准确捕捉其变化。新模型有望提升天气预报的准确性。

NVIDIA
United States原文链接
arXiv AI / CL热度 68AI 摘要

语言模型展现类人词序偏好

研究发现,语言模型在训练数据中未见过多修饰语名词短语的情况下,仍能偏好与人类相似的修饰语顺序,表明其能从有限输入中归纳出语言规律。

待识别