全球大模型进展新闻浏览站
中文头版English
输入关键词,快速查找已抓取新闻。

今日版 / 2026年9月27日星期日

limbo logolimbo

数据更新时间

9月24日 17:59

启用来源

17

抓取状态

真实抓取

Topic / research

研究进展

论文、基准、架构和多模态能力更新。

专题摘要

当前收录 100 条数据库新闻,来源由抓取后台更新。

更多收录

还有 97 条

arXiv AI / CL热度 89待摘要

Zing: Social Mind for LLMs

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

DeepSeek
arXiv AI / CL热度 89AI 摘要

语言表达如何影响大模型:信念表达方式对模型响应的影响

用户常向大语言模型表达信念,但表达方式(如预设、证据标记、语气等)会影响模型是否采纳上下文。研究引入分类法,系统评估17种语言表达类型对模型遵循上下文或坚持先验知识的影响,发现更大模型和指令模型更不遵循上下文。

LlamaQwenQwen3
The Decoder热度 89AI 摘要

Kimi发布开源模型K3,性能逼近GPT-5.6和Fable 5

Kimi推出开源多模态模型K3,拥有2.8万亿参数和百万token上下文。在自家基准测试中,K3接近Claude Fable 5和GPT 5.6 Sol,超越Opus 4.8和GLM 5.2,但价格显著高于前代。完整权重计划于7月27日前发布。

ClaudeFableGLMGPT
VentureBeat AI热度 89AI 摘要

企业AI基础设施支出加速,但成本可见度滞后

VentureBeat调查107家企业发现,AI基础设施支出远超成本可见度。仅21%的企业大规模部署AI,但45%计划评估专用AI云。GPU利用率低于50%的企业占83%,仅44%能严格追踪计算成本。64%的企业计划在一年内更换或增加供应商,38%将在下季度行动。

AnthropicAWSGoogleMicrosoft
United States原文链接
The Decoder热度 89AI 摘要

xAI发布Grok 4.5,价格仅为竞品零头

xAI发布Grok 4.5,基于数万块英伟达GB300 GPU训练。在编程基准测试中,该模型落后于Fable 5和GPT-5.5,但所需token数比Opus 4.8少4.2倍。每百万输入token仅需2美元,价格远低于竞争对手。预计7月中旬在欧盟上线。

NVIDIAxAIFableGPT
arXiv AI / CL热度 89AI 摘要

AI编程代理的持久状态攻击:跨拉取请求的分布式威胁

随着AI编程代理自主性增强,其迭代生成的代码在会话间持久化,创造了新的攻击面。恶意或提示注入的代理可将攻击分布到多个拉取请求中,并选择最佳时机触发。研究引入迭代VibeCoding框架,对比渐进式与非渐进式攻击,发现单一监控器无法同时防御两种策略,高规避率(≥65%)在多个模型间泛化。

ClaudeGeminiGPTKimi
The Decoder热度 89AI 摘要

Anthropic发布Claude Sonnet 5,性能逼近高端Opus系列

Anthropic推出Claude Sonnet 5模型,在各项基准测试中均超越前代Sonnet 4.6,并在GDPval-AA v2知识工作测试中以1618分略超高端Opus 4.8。公司指出,该模型在网络安全任务上的得分远低于美国政府目前封锁的模型,这可能是对当前辩论的有意信号。

AnthropicClaude
The Decoder热度 89AI 摘要

Anthropic推出Claude Science,专为研究人员打造的AI工作台

Anthropic发布Claude Science,一个面向研究人员的AI工作台。它提供60多项预配置技能,覆盖基因组学、计算化学等领域,并配备验证代理自动检查引用和计算。应用可在本地或HPC集群运行,确保敏感数据不离开实验室基础设施。

AnthropicClaude
arXiv AI / CL热度 89AI 摘要

OpenThoughts-Agent:开源智能体模型训练数据配方

OpenThoughts-Agent项目提出完全开源的数据筛选流程,用于训练通用智能体模型。通过100多次对照实验,系统研究各阶段重要性,并构建10万样本训练集。基于Qwen3-32B微调,在7个智能体基准上平均准确率44.8%,比最强开源模型Nemotron-Terminal-32B高3.9个百分点。

Qwen
VentureBeat AI热度 89AI 摘要

谷歌25年来首次重新设计搜索框,AI驱动多模态交互

谷歌在I/O大会上宣布重新设计搜索框,这是25年来首次重大更新。新搜索框支持文本、图片、PDF、视频和Chrome标签页等多模态输入,并整合AI概览与AI模式,提供无缝的对话式搜索体验。该设计基于Gemini 3.5 Flash模型,旨在提升速度和智能性。

GoogleGoogle DeepMindGemini
United States原文链接
VentureBeat AI热度 89AI 摘要

云平台Railway获1亿美元融资,挑战AWS等传统云巨头

旧金山云平台Railway宣布完成1亿美元B轮融资,由TQ Ventures领投。该公司已积累200万开发者,月处理超1000万次部署和1万亿次边缘网络请求。Railway通过自建数据中心实现垂直整合,提供亚秒级部署,声称可降低65%成本,并已吸引31%的财富500强企业使用。

AmazonAWSGoogleMicrosoft
United States原文链接
VentureBeat AI热度 89AI 摘要

Listen Labs 获 6900 万美元融资,用 AI 替代传统用户调研

AI 用户访谈平台 Listen Labs 完成 6900 万美元 B 轮融资,估值达 5 亿美元。该公司通过 AI 主持开放式视频访谈,替代传统问卷和人工访谈,将调研周期从数周缩短至数小时。其全球参与者网络达 3000 万人,并内置反欺诈系统。微软、Sweetgreen 等企业已采用该平台。

MicrosoftClaude
United States原文链接
VentureBeat AI热度 89AI 摘要

Salesforce 推出全新 Slackbot AI 代理,挑战微软和谷歌

Salesforce 发布了基于 Anthropic Claude 模型的全新 Slackbot,从简单通知工具升级为能搜索企业数据、起草文档并代表员工行动的 AI 代理。该产品已向 Business+ 和 Enterprise+ 客户开放,内部测试中 80% 员工持续使用,满意度达 96%。

AnthropicGoogleMicrosoftOpenAI
United States原文链接
VentureBeat AI热度 89AI 摘要

Anthropic推出Cowork:非技术用户也能用Claude操作本地文件

Anthropic发布Cowork,一个面向非技术用户的AI代理功能,允许Claude读取、编辑和创建本地文件夹中的文件。该功能基于Claude Code构建,团队仅用约一周半时间开发完成,部分代码由Claude Code自身编写。

AnthropicGoogleMicrosoftOpenAI
United States原文链接
VentureBeat AI热度 89AI 摘要

Nous Research发布开源编程模型NousCoder-14B,四天训练挑战Claude Code

Nous Research推出开源编程模型NousCoder-14B,在LiveCodeBench v6上准确率达67.87%,超越多个更大规模专有系统。模型仅用48块英伟达B200 GPU训练四天,并公开了完整训练框架,强调可复现性。此举正值Anthropic的Claude Code引发热议之际,凸显AI编程工具竞争白热化。

AlibabaAnthropicGoogleHugging Face
United States原文链接
Qwen Blog热度 89AI 摘要

Qwen3Guard:实时安全检测模型发布

Qwen 团队推出首个安全护栏模型 Qwen3Guard,基于 Qwen3 微调,可对提示和响应进行精确安全分类,包括风险等级和类别。在多项安全基准测试中达到领先水平,支持中英文及多语言环境。

Hugging FaceQwenQwen3
arXiv AI / CL热度 84AI 摘要

连续查询有限记忆语言模型提升知识检索效率

CO-LMLM是一种新型语言模型,它将事实知识存储在外部知识库中,而非模型权重内。生成时,模型通过连续向量查询从知识库检索文本知识,无需依赖关系型查询。在维基百科和FineWeb-Edu上预训练后,CO-LMLM在困惑度和事实准确性上优于先前模型和传统LLM。

ClaudeGPT
MIT Technology Review AI热度 84AI 摘要

Anthropic发布Claude Science,助力科学研究

Anthropic在面向药企高管、生物技术创始人和研究人员的活动中宣布推出Claude Science,这是一款旨在支持科学研究的新旗舰产品,类似于Claude Code对软件工程的辅助。Claude Science能根据简洁的高层指令自主执行有意义的工作。

AnthropicClaude
United States原文链接
OpenAI News热度 81待摘要

Introducing MentalHealthBench

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

待识别
United States原文链接
arXiv AI / CL热度 81AI 摘要

多模态推理中感知蒸馏的信用分配新方法

研究者提出感知校正蒸馏(PCD),一种无标签方法,通过下游失败和师生分歧作为互补证据,识别可纠正的感知失败。PCD使用软与门强化蒸馏,在八个基准测试中显著提升多模态推理性能。

待识别
arXiv AI / CL热度 81待摘要

Shieldstral

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

待识别
VentureBeat AI热度 81AI 摘要

企业AI代理安全缺口:54%已发生安全事件,身份隔离成短板

VentureBeat Pulse Research对107家企业的调查显示,54%的企业已遭遇AI代理安全事件或险情,但仅32%为每个代理分配独立身份,30%隔离高风险代理。安全工具多依赖模型提供商(如OpenAI防护栏占51%),专用代理安全产品采用率低。企业满意度虽高(4.2/5),但59%计划一年内更换工具。

AnthropicAWSGoogleMicrosoft
United States原文链接
arXiv AI / CL热度 81AI 摘要

RoboTTT:将机器人策略的上下文窗口扩展至8000步

NVIDIA 提出 RoboTTT,一种将机器人策略的视觉运动上下文扩展到 8000 时间步的方法,比现有最优策略高出三个数量级,且不增加推理延迟。该方法通过测试时训练实现单次人类视频模仿、在线策略改进和长时任务完成,性能提升 87%。

NVIDIA
arXiv AI / CL热度 81AI 摘要

MemOps:长程对话中生命周期内存操作的基准测试

MemOps 将对话内存重新定义为一系列生命周期操作,包括记忆、遗忘、更新、反思等,并生成结构化追踪记录。通过六类操作级探针评估,发现当前系统在长上下文、检索、参数化及托管内存模式下存在不同失败模式,如长上下文模型在重建有序内存状态轨迹方面表现较弱。

待识别
The Decoder热度 81AI 摘要

OpenAI GPT-5.6 Sol 自主微调小模型 Luna

OpenAI 的 GPT-5.6 Sol 在仅收到一个“相当不明确的提示”后,自主对较小的 Luna 模型进行了后训练。在 OpenAI 的内部递归自我改进基准测试中,Sol 得分比 GPT-5.5 高 16.2 分。OpenAI 认为“自动研究员”已触手可及。

OpenAIGPT
arXiv AI / CL热度 81AI 摘要

UniClawBench:首个面向真实世界任务的主动智能体基准

UniClawBench 是首个基于能力驱动的基准测试,用于评估在动态真实环境中运行的主动智能体。它围绕技能使用、探索、长上下文推理、多模态理解和跨平台协调五种基础能力,设计了400个双语真实世界任务,并通过实时Docker容器和细粒度检查点进行评估。

待识别
arXiv AI / CL热度 81AI 摘要

OpenCoF:通过视频生成实现推理能力

OpenCoF 框架包含 OpenCoF-17K 数据集和 Wan-CoF 模型,通过时间帧序列(Chain-of-Frame)进行推理。在四个视频推理基准上,Wan-CoF 相比基线模型取得显著提升,并探索了视觉和文本推理令牌的作用。

待识别
arXiv AI / CL热度 81AI 摘要

多模态科学基础模型实现跨学科结构推理

SciReasoner模型通过统一的结构感知词汇表,将蛋白质、小分子和无机晶体的坐标、拓扑和周期性连接离散化为可寻址证据单元,在86项基准测试中67项达到最优,并在基因本体预测、逆合成分析和材料相分离等任务上显著提升性能。

待识别
OpenAI News热度 81AI 摘要

OpenAI分析揭示SWE-Bench Pro编码基准可靠性问题

OpenAI最新分析指出,流行的编码基准SWE-Bench Pro存在信号与噪声混杂的问题,引发对其评估AI模型可靠性和准确性的担忧。该研究强调了基准测试中可能存在的偏差和局限性。

OpenAI
United States原文链接
arXiv AI / CL热度 81AI 摘要

LACUNA:评估大模型遗忘精准度的新测试平台

LACUNA是首个提供参数级定位基准的遗忘测试平台,通过向OLMo模型注入合成个人身份信息,评估现有遗忘方法是否真正擦除知识。研究发现,当前方法虽在输出层面表现良好,但定位不精准,易受重新浮现攻击。

待识别
arXiv AI / CL热度 81AI 摘要

长视频质量理解基准LongVQUBench发布

LongVQUBench是一个针对大视觉语言模型的长视频质量理解基准,包含1200多个视频和1500个问题,涵盖电影、纪录片等多种类型。它通过三个层次评估模型对局部、跨事件和全局质量的理解,并嵌入“针尖失真问答”任务。实验显示,现有模型在长视频和深度推理上表现不佳。

待识别
arXiv AI / CL热度 81AI 摘要

对抗蒸馏提升认证鲁棒性,新方法实现最优性能

AD-CERT是一种结合对抗蒸馏与区间边界传播的认证训练方法。它利用经验鲁棒教师模型的逻辑层信息作为下界代理,在多个鲁棒性基准上取得最先进认证性能,相比特征空间蒸馏提升高达5.40个百分点。

待识别
arXiv AI / CL热度 81AI 摘要

世界模型碎片化:通用智能体的结构性认证方法

在“大世界”场景下,智能体无法具备通用能力,其能力必然专精于碎片化的世界模型。标准均匀保证无法区分关键瓶颈与无关失败。本文通过证明通用智能体并非万能,引入结构性认证框架,将有界目标条件性能映射到智能体内部世界模型的逐项保证,并给出算法实现。

待识别
MIT Technology Review AI热度 76AI 摘要

AI教授应对学术研究新现实

上周,在加州山景城的一家酒店,一些最杰出的AI研究人员聚集一堂,讨论人工智能学术研究的新现实。他们探讨了AI领域快速变化带来的挑战与机遇。

待识别
United States原文链接
The Decoder热度 76AI 摘要

亚马逊收缩Nova AI模型,押注前沿研究团队

据报道,亚马逊正在缩减其大部分内部Nova AI模型的开发,包括Nova Premier、Omni、Reel和Canvas。这些模型将仅维持现有客户的基本运行,不再积极开发。取而代之的是,亚马逊将重点放在新成立的前沿模型研究团队上,并计划在今年秋季的re:Invent大会上推出新的基础模型。

Amazon