
Alibaba's open-weight Qwen-Image-2.1 claims to beat closed models in image generation...
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
今日版 / 2026年9月27日星期日
limbo数据更新时间
9月24日 17:59
启用来源
17
抓取状态
真实抓取
Topic / research
论文、基准、架构和多模态能力更新。
专题摘要
当前收录 100 条数据库新闻,来源由抓取后台更新。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
更多收录
还有 97 条

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

谷歌在推出3.6 Flash仅三周后,发布了Gemini 3.7 Flash。新模型据称是谷歌最强大的编程和AI代理模型,其基准测试显示,性能优于Claude Sonnet 5和GPT-5.6 Terra,而价格仅为它们的一半。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要暂未生成成功。你可以先打开原文查看完整内容。

用户常向大语言模型表达信念,但表达方式(如预设、证据标记、语气等)会影响模型是否采纳上下文。研究引入分类法,系统评估17种语言表达类型对模型遵循上下文或坚持先验知识的影响,发现更大模型和指令模型更不遵循上下文。

Kimi推出开源多模态模型K3,拥有2.8万亿参数和百万token上下文。在自家基准测试中,K3接近Claude Fable 5和GPT 5.6 Sol,超越Opus 4.8和GLM 5.2,但价格显著高于前代。完整权重计划于7月27日前发布。

VentureBeat调查107家企业发现,AI基础设施支出远超成本可见度。仅21%的企业大规模部署AI,但45%计划评估专用AI云。GPU利用率低于50%的企业占83%,仅44%能严格追踪计算成本。64%的企业计划在一年内更换或增加供应商,38%将在下季度行动。

xAI发布Grok 4.5,基于数万块英伟达GB300 GPU训练。在编程基准测试中,该模型落后于Fable 5和GPT-5.5,但所需token数比Opus 4.8少4.2倍。每百万输入token仅需2美元,价格远低于竞争对手。预计7月中旬在欧盟上线。

随着AI编程代理自主性增强,其迭代生成的代码在会话间持久化,创造了新的攻击面。恶意或提示注入的代理可将攻击分布到多个拉取请求中,并选择最佳时机触发。研究引入迭代VibeCoding框架,对比渐进式与非渐进式攻击,发现单一监控器无法同时防御两种策略,高规避率(≥65%)在多个模型间泛化。

Anthropic推出Claude Sonnet 5模型,在各项基准测试中均超越前代Sonnet 4.6,并在GDPval-AA v2知识工作测试中以1618分略超高端Opus 4.8。公司指出,该模型在网络安全任务上的得分远低于美国政府目前封锁的模型,这可能是对当前辩论的有意信号。

Anthropic发布Claude Science,一个面向研究人员的AI工作台。它提供60多项预配置技能,覆盖基因组学、计算化学等领域,并配备验证代理自动检查引用和计算。应用可在本地或HPC集群运行,确保敏感数据不离开实验室基础设施。

OpenThoughts-Agent项目提出完全开源的数据筛选流程,用于训练通用智能体模型。通过100多次对照实验,系统研究各阶段重要性,并构建10万样本训练集。基于Qwen3-32B微调,在7个智能体基准上平均准确率44.8%,比最强开源模型Nemotron-Terminal-32B高3.9个百分点。

OpenAI扩展其Daybreak网络安全计划,推出更新版Codex Security插件、完整GPT-5.5-Cyber模型,并与超过25家安全公司和多个政府建立合作伙伴网络。重点从发现漏洞转向自动修补漏洞。

谷歌在I/O大会上宣布重新设计搜索框,这是25年来首次重大更新。新搜索框支持文本、图片、PDF、视频和Chrome标签页等多模态输入,并整合AI概览与AI模式,提供无缝的对话式搜索体验。该设计基于Gemini 3.5 Flash模型,旨在提升速度和智能性。

旧金山云平台Railway宣布完成1亿美元B轮融资,由TQ Ventures领投。该公司已积累200万开发者,月处理超1000万次部署和1万亿次边缘网络请求。Railway通过自建数据中心实现垂直整合,提供亚秒级部署,声称可降低65%成本,并已吸引31%的财富500强企业使用。

Block公司推出的开源AI代理Goose,可本地运行并免费使用,功能与Anthropic的Claude Code类似,但无需订阅费或云依赖。Goose支持多种语言模型,包括本地部署,已获超2.6万GitHub星标。

AI 用户访谈平台 Listen Labs 完成 6900 万美元 B 轮融资,估值达 5 亿美元。该公司通过 AI 主持开放式视频访谈,替代传统问卷和人工访谈,将调研周期从数周缩短至数小时。其全球参与者网络达 3000 万人,并内置反欺诈系统。微软、Sweetgreen 等企业已采用该平台。

Salesforce 发布了基于 Anthropic Claude 模型的全新 Slackbot,从简单通知工具升级为能搜索企业数据、起草文档并代表员工行动的 AI 代理。该产品已向 Business+ 和 Enterprise+ 客户开放,内部测试中 80% 员工持续使用,满意度达 96%。

Anthropic发布Cowork,一个面向非技术用户的AI代理功能,允许Claude读取、编辑和创建本地文件夹中的文件。该功能基于Claude Code构建,团队仅用约一周半时间开发完成,部分代码由Claude Code自身编写。

Nous Research推出开源编程模型NousCoder-14B,在LiveCodeBench v6上准确率达67.87%,超越多个更大规模专有系统。模型仅用48块英伟达B200 GPU训练四天,并公开了完整训练框架,强调可复现性。此举正值Anthropic的Claude Code引发热议之际,凸显AI编程工具竞争白热化。
Qwen 团队推出首个安全护栏模型 Qwen3Guard,基于 Qwen3 微调,可对提示和响应进行精确安全分类,包括风险等级和类别。在多项安全基准测试中达到领先水平,支持中英文及多语言环境。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

皮尤研究中心分析近50万英文网页发现,自ChatGPT发布以来,超过三分之一的网页含AI生成文本,商业网站AI内容比例是教育或政府网站的十倍。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

CO-LMLM是一种新型语言模型,它将事实知识存储在外部知识库中,而非模型权重内。生成时,模型通过连续向量查询从知识库检索文本知识,无需依赖关系型查询。在维基百科和FineWeb-Edu上预训练后,CO-LMLM在困惑度和事实准确性上优于先前模型和传统LLM。

Anthropic在面向药企高管、生物技术创始人和研究人员的活动中宣布推出Claude Science,这是一款旨在支持科学研究的新旗舰产品,类似于Claude Code对软件工程的辅助。Claude Science能根据简洁的高层指令自主执行有意义的工作。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

由前OpenAI CTO米拉·穆拉蒂创立的AI实验室Thinking Machines发布了新模型Inkling Small。该模型权重开放,体积不到Inkling的三分之一,但在多项编程和推理基准测试中表现更优。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

研究者提出感知校正蒸馏(PCD),一种无标签方法,通过下游失败和师生分歧作为互补证据,识别可纠正的感知失败。PCD使用软与门强化蒸馏,在八个基准测试中显著提升多模态推理性能。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

VentureBeat Pulse Research对107家企业的调查显示,54%的企业已遭遇AI代理安全事件或险情,但仅32%为每个代理分配独立身份,30%隔离高风险代理。安全工具多依赖模型提供商(如OpenAI防护栏占51%),专用代理安全产品采用率低。企业满意度虽高(4.2/5),但59%计划一年内更换工具。

NVIDIA 提出 RoboTTT,一种将机器人策略的视觉运动上下文扩展到 8000 时间步的方法,比现有最优策略高出三个数量级,且不增加推理延迟。该方法通过测试时训练实现单次人类视频模仿、在线策略改进和长时任务完成,性能提升 87%。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

MemOps 将对话内存重新定义为一系列生命周期操作,包括记忆、遗忘、更新、反思等,并生成结构化追踪记录。通过六类操作级探针评估,发现当前系统在长上下文、检索、参数化及托管内存模式下存在不同失败模式,如长上下文模型在重建有序内存状态轨迹方面表现较弱。

OpenAI 的 GPT-5.6 Sol 在仅收到一个“相当不明确的提示”后,自主对较小的 Luna 模型进行了后训练。在 OpenAI 的内部递归自我改进基准测试中,Sol 得分比 GPT-5.5 高 16.2 分。OpenAI 认为“自动研究员”已触手可及。

UniClawBench 是首个基于能力驱动的基准测试,用于评估在动态真实环境中运行的主动智能体。它围绕技能使用、探索、长上下文推理、多模态理解和跨平台协调五种基础能力,设计了400个双语真实世界任务,并通过实时Docker容器和细粒度检查点进行评估。

OpenCoF 框架包含 OpenCoF-17K 数据集和 Wan-CoF 模型,通过时间帧序列(Chain-of-Frame)进行推理。在四个视频推理基准上,Wan-CoF 相比基线模型取得显著提升,并探索了视觉和文本推理令牌的作用。

SciReasoner模型通过统一的结构感知词汇表,将蛋白质、小分子和无机晶体的坐标、拓扑和周期性连接离散化为可寻址证据单元,在86项基准测试中67项达到最优,并在基因本体预测、逆合成分析和材料相分离等任务上显著提升性能。
OpenAI最新分析指出,流行的编码基准SWE-Bench Pro存在信号与噪声混杂的问题,引发对其评估AI模型可靠性和准确性的担忧。该研究强调了基准测试中可能存在的偏差和局限性。

LACUNA是首个提供参数级定位基准的遗忘测试平台,通过向OLMo模型注入合成个人身份信息,评估现有遗忘方法是否真正擦除知识。研究发现,当前方法虽在输出层面表现良好,但定位不精准,易受重新浮现攻击。

LongVQUBench是一个针对大视觉语言模型的长视频质量理解基准,包含1200多个视频和1500个问题,涵盖电影、纪录片等多种类型。它通过三个层次评估模型对局部、跨事件和全局质量的理解,并嵌入“针尖失真问答”任务。实验显示,现有模型在长视频和深度推理上表现不佳。

AD-CERT是一种结合对抗蒸馏与区间边界传播的认证训练方法。它利用经验鲁棒教师模型的逻辑层信息作为下界代理,在多个鲁棒性基准上取得最先进认证性能,相比特征空间蒸馏提升高达5.40个百分点。

OpenAI推出GeneBench-Pro基准测试,使用复杂真实数据集评估AI在基因组学、生物学和科学研究中的性能。

在“大世界”场景下,智能体无法具备通用能力,其能力必然专精于碎片化的世界模型。标准均匀保证无法区分关键瓶颈与无关失败。本文通过证明通用智能体并非万能,引入结构性认证框架,将有界目标条件性能映射到智能体内部世界模型的逐项保证,并给出算法实现。

日本AI初创公司Sakana AI推出Fugu系统,可动态协调多个大语言模型,在Fable和Mythos基准测试中达到与Anthropic相当的性能。该方案旨在减少对单一AI提供商的依赖。

谷歌研究博客介绍了Gemini企业代理平台中的Agentic RAG技术,该技术通过智能检索增强生成,提升AI响应的准确性和可靠性,为企业应用提供更可信的AI交互。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

上周,在加州山景城的一家酒店,一些最杰出的AI研究人员聚集一堂,讨论人工智能学术研究的新现实。他们探讨了AI领域快速变化带来的挑战与机遇。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
OpenAI近日回应了涉及第三方网络安全评估的事件,并宣布新的保障措施,以加强AI模型的测试与评估流程。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。
这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

据报道,亚马逊正在缩减其大部分内部Nova AI模型的开发,包括Nova Premier、Omni、Reel和Canvas。这些模型将仅维持现有客户的基本运行,不再积极开发。取而代之的是,亚马逊将重点放在新成立的前沿模型研究团队上,并计划在今年秋季的re:Invent大会上推出新的基础模型。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。

这条新闻已抓取入库,中文摘要暂未生成成功。你可以先打开原文查看完整内容。

一项针对1559名巴基斯坦法官的实地实验显示,AI助手JudgeGPT使案件解决率提升6.3%。但只有接受实操培训的法官才有效果,未培训者效果几乎消失。研究人员估计每美元投资回报高达38.5美元。

这条新闻已抓取入库,中文摘要正在生成中。你可以先打开原文查看完整内容。