Skip to the content.

从 461 条内容中筛选出 25 条重要资讯。


  1. OpenAI 推出 GPT-Live,实现连续低延迟语音 AI 交互 ⭐️ 9.0/10
  2. 美团发布 LongCat-2.0:五万卡国产算力集群训练万亿参数模型 ⭐️ 9.0/10
  3. DiffusionGemma:基于离散扩散并行解码 256 个令牌的语言模型 ⭐️ 9.0/10
  4. Shai-Hulud 供应链攻击波及 Keyv 及相关 npm 包 ⭐️ 8.0/10
  5. 面向自我改进 LLM 智能体的 Harness 工程 ⭐️ 8.0/10
  6. Swiftlet 让 Mac 仅用 4.3GB 内存运行 80B Qwen,iPhone 可跑 35B ⭐️ 8.0/10
  7. OpenAI 公布数学与理论计算机科学十项进展 ⭐️ 8.0/10
  8. 文章认为大语言模型奖励领域专业知识 ⭐️ 8.0/10
  9. AirLLM:无需量化即可在单张 4GB GPU 上运行 70B 大模型 ⭐️ 8.0/10
  10. 微软推出面向初学者的 21 节生成式 AI 课程 ⭐️ 8.0/10
  11. 系统设计入门指南:大规模系统设计与面试准备 ⭐️ 8.0/10
  12. antirez 发布 DwarfStar(ds4):面向 DeepSeek V4 Flash/PRO 与 GLM 的专注本地推理引擎 ⭐️ 8.0/10
  13. LiveKit Agents:实时语音 AI 智能体开源框架 ⭐️ 8.0/10
  14. 我国首部 L3/L4 自动驾驶强制性安全国标发布 ⭐️ 8.0/10
  15. OpenAI 否认苹果诉讼,公布证据 ⭐️ 8.0/10
  16. JFrog 发现 SQLite 严重 CVE 完全是 LLM 生成的垃圾内容 ⭐️ 8.0/10
  17. NetBSD 11.0 发布,新增 RISC-V 移植 ⭐️ 8.0/10
  18. NVIDIA 提出世界动作模型,提升机器人操作泛化能力 ⭐️ 8.0/10
  19. NVIDIA 详解如何用 Kai 调度器在共享 GPU 上运行隔离租户 Kubernetes 集群 ⭐️ 8.0/10
  20. 美团开源 LoHoSearch:用知识图谱校准搜索智能体能力评测 ⭐️ 8.0/10
  21. MineExplorer:首个开放世界长程任务评测基准揭示多模态大模型能力短板 ⭐️ 8.0/10
  22. 美团正式开源 LongCat-2.0:1.6T 参数智能体编程模型 ⭐️ 8.0/10
  23. LongCat 开源 VitaBench 2.0:长期动态智能体评测新基准 ⭐️ 8.0/10
  24. RagTester 实现 RAG 系统自动化端到端测试 ⭐️ 8.0/10
  25. 生产级 GitHub Copilot 研究揭示智能体编码模式 ⭐️ 8.0/10

OpenAI 推出 GPT-Live,实现连续低延迟语音 AI 交互 ⭐️ 9.0/10

OpenAI 推出了 GPT-Live,这是一个在六个月内构建的实时语音交互系统。它采用无轮次语音模型和低延迟架构,让 ChatGPT Voice 能够进行连续、更自然的对话。 GPT-Live 通过消除僵化的轮流发言机制,标志着向自然、实时的人机对话迈出了重要一步。它可能重塑整个行业的语音界面、无障碍工具和实时系统设计。 该系统用连续音频流和专用低延迟媒体通路取代了传统的轮次检测,并采用全双工模型。据报道,这种架构在保持响应性的同时,实现了更快、更流畅的交流。

rss · OpenAI News · 8月3日 07:00

背景: 传统语音助手依赖基于轮次的交互,通过按键说话或语音活动检测来判断用户是否说完。GPT-Live 则改为连续传输音频并直接建模语音,让用户无需等待轮次即可说话并被听到。该项目是 OpenAI 在 2026 年初重建 WebRTC 技术栈以实现低延迟全球服务之后,扩大实时语音 AI 规模的更广泛努力的一部分。

参考链接

标签: #voice AI, #realtime, #GPT, #low-latency, #speech


美团发布 LongCat-2.0:五万卡国产算力集群训练万亿参数模型 ⭐️ 9.0/10

美团发布了 LongCat-2.0,这是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型。它拥有 1.6T 总参数、平均激活约 480 亿参数,并原生支持 1M 超长上下文。 这标志着国产 AI 算力基础设施的重大突破,证明大规模模型训练可以不依赖高端进口芯片完成。同时,它以超长上下文推动了 Agentic Coding 的前沿发展,有望广泛惠及开发者和 AI 工程实践。 LongCat-2.0 采用混合专家(MoE)架构,动态激活参数范围为 330 亿至 560 亿。它从零开始预训练,专注于在真实 Agentic Coding 任务中高效、稳定地完成代码理解、生成与执行。

rss · 美团 Blog · 8月4日 17:51

背景: 像 LongCat-2.0 这样的 MoE 模型拥有庞大的总参数量,但每个 token 只激活其中一部分,从而降低推理成本。近期已有华为昇腾等国产算力集群用于大模型训练,但在五万卡国产加速器上完成万亿参数模型的全流程训练与推理尚属首次。Agentic Coding 指让 AI 智能体根据自然语言需求自主编写、运行和调试代码,而不仅仅是简单的自动补全。

参考链接

标签: #大模型, #国产算力, #万亿参数, #Agentic Coding, #长上下文


DiffusionGemma:基于离散扩散并行解码 256 个令牌的语言模型 ⭐️ 9.0/10

谷歌发布了实验性开源权重语言模型 DiffusionGemma,它在 Gemma 4 MoE 模型基础上微调而来,利用离散扩散并行精炼 256 个 token 的块,而不是逐个 token 解码。在单个 NVIDIA H100 GPU 上,其每秒可输出约 1,500 个 token,每次前向传播约生成 20 个 token。 这项工作打破了自回归大语言模型的顺序解码瓶颈,在生成速度与模型能力之间建立了一条新的帕累托前沿。它有望显著降低长文本生成的推理成本与延迟,而且保留了对多模态、长上下文和思考模式的支持,因此具有实际应用价值。 DiffusionGemma 的激活参数为 38 亿、总参数为 252 亿,其两阶段训练流程所用的 token 预算不足原始自回归模型的 10%:第一阶段是监督微调,第二阶段将强化学习与采样器蒸馏(sampler distillation)相结合。该模型仍能以自回归方式解码,且性能仅有轻微下降,为混合扩散与自回归解码提供了可能。

rss · arXiv cs.CL · 8月4日 04:00

背景: 自回归大语言模型每次只生成一个 token,这限制了解码速度;离散扩散模型则通过迭代去噪并行生成多个 token,因此近年来在高效生成领域受到越来越多关注。采样器蒸馏是一种让学生采样器用更少的步数模仿高质量教师采样器的技术。DiffusionGemma 将这些思路应用到了 Gemma 4 上,后者是谷歌的开源权重模型系列,包含混合专家(MoE)变体。

参考链接

标签: #diffusion models, #large language models, #inference efficiency, #parallel decoding, #Gemma


Shai-Hulud 供应链攻击波及 Keyv 及相关 npm 包 ⭐️ 8.0/10

在一次活跃攻击中,Shai-Hulud 蠕虫入侵了 Keyv npm 包及其相关包,并于 2026 年 8 月 4 日蔓延到十二个组织的 400 多个 npm 包。该凭据窃取恶意软件污染了 79 个包名下的至少 353 个版本,包括 Keyv 和 cacheable 系列。 Keyv 是 Node.js 生态中广泛使用的键值存储接口,因此这次攻击可能影响无数下游应用和 CI 流水线。这凸显了 npm 依赖链的脆弱性,以及加强供应链防御的必要性。 该蠕虫携带字节级相同的凭据窃取器,并留下恶意的仓库钩子(repository hooks),因此即使清理后风险依然存在。据 SafeDep 称,大多数受影响软件包的最新版本仍然解析到被污染版本,身份验证库也属于被入侵的包之列。

hackernews · cimi_ · 8月4日 11:01 · 社区讨论

背景: 供应链攻击通过向热门软件包中注入恶意代码来攻击软件构建过程,并随后扩散到依赖它的项目中。Shai-Hulud 是一个已知的攻击家族,此前已入侵数百个 npm 包并窃取开发者凭据。Keyv 通过存储适配器为多种后端的键值存储提供一致的接口,因此是许多 Node.js 应用中常见的传递依赖。

参考链接

社区讨论: 评论者对当前依赖系统的脆弱性表示不满,称其为‘玻璃下巴’架构,使此类攻击既有效又难以清理。实用建议包括在 .npmrc 中设置 ‘min-release-age=5’,对新增的 pre-install 钩子极度警惕,甚至暂停所有新的安装钩子。少数评论者毫无根据地猜测安全厂商可能通过植入此类攻击来制造需求,还有人询问如何用 grep 检查自己的 node_modules。

标签: #supply chain security, #npm, #malicious packages, #cybersecurity, #open source


面向自我改进 LLM 智能体的 Harness 工程 ⭐️ 8.0/10

2026 年 7 月 4 日,Lilian Weng 发表了一篇博客文章,探讨如何工程化和优化 LLM 智能体周围的 Harness(提示、技能和工具),以实现自我改进和更优性能。该文将 Harness 工程确立为智能体开发中的关键学科。 这之所以重要,是因为它指出了超越模型权重来改进 LLM 智能体的新前沿:优化外部 Harness。它可以帮助工程师、组织和智能体框架从基于 LLM 的系统中获得更高的质量和成本效率。 该文将 Harness 工程定义为一个包含提示、技能、工具、传感器、护栏和编排的学科,并借鉴了 2026 年初出现的新词汇。社区讨论强调了为代码库建立通用适应度函数的必要性,并警告不要对基准测试过度拟合。

hackernews · tosh · 8月4日 06:17 · 社区讨论

背景: Harness 工程,又称智能体 Harness 或脚手架,是包围基于 LLM 的智能体的外部结构,包括提示、记忆、工具、护栏和协调,用于控制智能体如何与环境交互。这个术语在实践者中流传,直到 2026 年初才被正式命名。自我改进的 AI 智能体旨在通过反馈、验证器和技能积累持续增强自身能力,这一课题如今已被纳入斯坦福大学 CS329A 等课程。

参考链接

社区讨论: 评论者积极参与讨论:bisonbear 讨论了在组织层面为大型代码库实施 Harness 优化,并强调需要可靠的适应度函数;cahaya 分享了使用爬山实验和 Codex 中的 Harness 工程技能来改进一个类似 Cursor 的应用;zby 认为“训练权重已见顶”,并提出了针对提示和代码的训练范式;datadrivenangel 警告要避免过度拟合以致作弊,并附上了一篇 arXiv 论文链接;Kinrany 则开玩笑地提到了“Torment Nexus”。

标签: #AI agents, #harness engineering, #self-improvement, #LLM, #tooling


Swiftlet 让 Mac 仅用 4.3GB 内存运行 80B Qwen,iPhone 可跑 35B ⭐️ 8.0/10

一个名为 Swiftlet 的新开源工具利用内存映射和混合专家(MoE)稀疏性,在 Mac 上仅用 4.3GB 内存即可运行 80B 参数的 Qwen 模型,在 iPhone 上可运行 35B 模型。该项目以 Show HN 形式发布在 Hacker News 上。 这推动了端侧 LLM 推理的边界,表明非常大的 MoE 模型可以在内存有限的消费硬件上运行。它可能使大型模型的使用更加普及,减少对云的依赖,并影响 Apple 等公司未来硬件和软件对本地 AI 的设计。 该方法利用内存映射避免将整个模型载入 RAM,并结合 MoE 稀疏性,每个 token 仅激活部分参数。对于内存更大的用户,增加缓存可显著提升推理速度;该项目以 TurboFieldfare 为起点构建。

hackernews · leonickson · 8月3日 16:54 · 社区讨论

背景: 混合专家(MoE)模型包含许多专门子网络,每个输入只激活少数子网络,因此比稠密模型更稀疏、更高效。内存映射让操作系统按需将模型权重分页调入/调出 RAM,因此大于物理内存的模型也能运行。像 Swiftlet 这样的端侧推理工具旨在让大语言模型在手机和笔记本上本地运行,避免云 API 的延迟和隐私问题。

参考链接

社区讨论: 评论者普遍持正面态度,称赞该项目是迈向实用本地 AI 的一步,并提到 Apple 押注高效端侧 LLM 的潜力。一些人计划用更多内存测试以加快推理,另一些人则希望 RAM 使用可调,以便用内存换取速度。TurboFieldfare 的作者感谢创作者在其基础上构建并署名。

标签: #on-device AI, #LLM inference, #MoE, #Apple Silicon, #open-source


OpenAI 公布数学与理论计算机科学十项进展 ⭐️ 8.0/10

OpenAI 发布了《数学与理论计算机科学十项进展》,其中包含在几何、密码学和复杂性理论等长期未解问题上的新结果。随附的 GitHub 仓库提供了这些证明的 Lean 4 形式化版本,并由团队使用 mathlib 库进行了验证。 这一公告表明,AI 系统正在成为数学发现中的可靠伙伴,而不仅仅是计算工具。如果这些结果经得起检验,它们可能加速数学和理论计算机科学的研究,并改变证明的生成与验证方式。 openai/ten-proofs 仓库指定了 Lean 4.32.0、mathlib 和 Lake,并包含所公布定理的正式证明证书。这些成果涉及几何、密码学和复杂性理论,不过考虑到 OpenAI 的研究宣传,该公告也可能带有一定的推广色彩。

hackernews · milkshakes · 8月3日 16:27 · 社区讨论

背景: Lean 和 Coq 等形式化证明助手允许数学家将定理编码,并机械地检查证明的每一步,从而消除人工验证中的错误。近期在自动定理证明方面的工作将这些系统与 AI 模型结合,后者可以提出证明步骤或搜索反例,使以前难以处理的验证任务变得日益可计算。OpenAI 采用这种方法来攻克开放问题,并与研究社区共享机器验证的证明。

参考链接

社区讨论: 评论者大多对 AI 在数学领域的快速、看似指数级的进步感到惊叹,同时也有人担心这会削弱人类在发现中的角色。有讨论指出,当前模型无法凭直觉提出新猜想,但可以快速完成反例的苦力活;还有人开玩笑引用道格拉斯·亚当斯的话,暗示数学家的营生可能会被颠覆。

标签: #artificial intelligence, #mathematics, #theoretical computer science, #research, #OpenAI


文章认为大语言模型奖励领域专业知识 ⭐️ 8.0/10

一篇被广泛分享的文章指出,大语言模型(LLM)放大的是使用者已有的领域专业知识,而非替代它。作者认为,新手往往难以有效利用 AI,因为他们缺乏拆分问题、引导提示词以及评估输出结果的能力。 这一点很重要,因为它直接挑战了“任何人都能用 AI 写软件”的流行说法。对工程团队和开发者个人而言,这意味着深厚的领域知识仍然是利用 AI 辅助开发获得实际价值的关键。 这篇文章在社区中获得了 1266 个赞和 518 条评论,反映出强烈的社区关注度,并被评分为 8.0/10。其核心论点强调,问题分解、提示词引导和结果评估等技能决定了使用者能多好地利用大语言模型。

hackernews · MaxMussio · 8月3日 21:13 · 社区讨论

背景: 大语言模型是基于海量文本和代码训练的人工智能系统,能根据提示生成看似合理的回答。这篇文章参与了一个更广泛的讨论:AI 编程助手究竟是拉平了能力差距,还是拉大了专家与新手之间的距离。过去“人人都会用 AI 编程”的说法常常忽略了使用者需要领域知识来引导、验证和迭代生成结果。

社区讨论: 社区评论者大多认同这一观点,并分享了支持性的轶事和类比。一位用户描述了看到一名非程序员在没有工程指导的情况下尝试用 LLM 做简单网页应用而失败;另一位将 LLM 比作“放大镜式镜子”,认为它反映的是使用者自身的思考质量。讨论中还有人用医生采集病史的流程作类比,并呼吁进行正式研究;也有评论者承认自己无法排除确认偏误的影响。

标签: #llm, #ai-assisted-development, #human-expertise, #prompt-engineering, #productivity


AirLLM:无需量化即可在单张 4GB GPU 上运行 70B 大模型 ⭐️ 8.0/10

AirLLM 是一个开源推理框架,通过降低显存占用,让 70B 参数的大模型能在单张 4GB GPU 上运行,405B 参数的 Llama 3.1 可在 8GB 显存上运行,全程无需量化、蒸馏或剪枝。截至 2026 年 7 月,它还支持在不到 4GB 显存下运行 Kimi K3(2.8T 参数),方式是仅流式加载 token 实际路由到的专家。 这大幅降低了大型模型推理的硬件门槛,让研究人员和开发者能在消费级 GPU 上运行最先进的开源模型。它挑战了“70B 以上模型必须使用高端多卡服务器”的固有认知,让低资源环境也能参与大模型应用与研究。 核心技术是逐层执行:推理时每个 transformer 层只需要上一层的输出,因此 AirLLM 每次只加载并计算一层。对于 Kimi K3 这类稀疏 MoE 模型,它只流式加载单个专家而非完整层,从而进一步降低显存占用;Kimi K3 还需要安装 compressed-tensors、flash-attn,并使用 CUDA 12 版 PyTorch。

rss · GitHub Trending - Daily · 8月4日 17:51

背景: 大语言模型通常需要同时把全部权重放入 GPU 显存;仅一个 70B 模型在 16 位精度下就需要约 140GB,远超大多数单卡显存。常规解决方案是量化(降低精度)、蒸馏(训练更小的模型)或剪枝(删除部分权重),但这些都可能影响质量。AirLLM 则保持完整精度,按需流式加载层,用一定速度换取显存占用的大幅下降。

参考链接

标签: #LLM, #inference optimization, #GPU memory, #open source, #efficient AI


微软推出面向初学者的 21 节生成式 AI 课程 ⭐️ 8.0/10

微软的开源“Generative AI for Beginners”仓库提供了一个免费、多语言的 21 节课程,教授如何构建生成式 AI 应用。该课程在 GitHub 上获得了显著关注并登上趋势榜。 该课程为希望进入快速发展的生成式 AI 领域的开发者和研究人员降低了入门门槛,提供了结构化的学习路径和实际应用构建练习。它也反映了大型科技公司投资于普及 AI 教育的更广泛行业趋势。 该课程支持多语言,通过 GitHub Actions 自动维护翻译,课程内容包括 LLM 基础、提示工程和应用程序构建。它是微软“AI for Beginners”教育系列的一部分,欢迎社区贡献。

rss · GitHub Trending - Daily · 8月4日 17:51

背景: 生成式 AI 是指通过从现有数据中学习模式来创造新内容(如文本、图像、视频和代码)的人工智能。大型语言模型(LLM)是许多生成式 AI 应用背后的关键技术,通过在大量文本数据上训练来理解并生成类似人类的语言。初学者通常需要掌握这些概念的基础知识才能有效构建生成式 AI 应用,这正是本课程旨在提供的内容。

参考链接

标签: #generative-ai, #education, #tutorial, #microsoft, #llm


系统设计入门指南:大规模系统设计与面试准备 ⭐️ 8.0/10

这条新闻介绍了 GitHub 仓库“system-design-primer”,这是一个全面的开源指南,用于学习如何设计大规模系统并准备系统设计面试。它聚合了大量资源,并包含用于间隔重复学习的 Anki 闪卡。 系统设计面试是许多大型科技公司技术招聘的必备环节,因此这一资源帮助工程师有效准备。它的广泛采用和社区翻译工作使其成为全球开发者的重要教育工具。 该仓库是一个系统设计原理的有机集合,涵盖可扩展性、架构以及带讨论、代码和图示的面试样例解决方案。它被翻译成多种语言,包括日语、中文和阿拉伯语,并鼓励社区贡献。

rss · GitHub Trending - Daily · 8月4日 17:51

背景: 系统设计面试通常要求候选人在 45 至 60 分钟内设计类似 Twitter 或 Uber 的大规模系统架构,测试高层次和低层次的设计能力。Anki 是一款使用间隔重复技术的免费闪卡程序,帮助学习者优先掌握有挑战性的内容,因此常被用作技术面试学习指南的补充工具。

参考链接

标签: #system design, #interview preparation, #scalability, #architecture, #education


antirez 发布 DwarfStar(ds4):面向 DeepSeek V4 Flash/PRO 与 GLM 的专注本地推理引擎 ⭐️ 8.0/10

Redis 作者 antirez 发布了 DwarfStar(ds4),一个面向 DeepSeek V4 Flash 优化的自包含本地推理引擎,并支持 GLM 5.2 以及在高内存机器上运行 DeepSeek V4 PRO。它提供了 Metal、CUDA 和 ROCm 后端,并包含用于 GGUF、imatrix、质量和速度评估的工具。 该项目将能力强大的开放权重模型带到消费级硬件上,例如 128 GB MacBook、DGX Spark 和 Strix Halo,并可将较旧的 CUDA 服务器转变为多用户 LLM 服务系统。它也展示了 antirez 构建刻意窄化推理栈的工程思路,与 llama.cpp 这类通用运行器形成对比。 支持的后端包括 Metal(主要目标,适用于 96 GB 及以上的 Mac,较小机器可使用 SSD 流式加载)、NVIDIA CUDA(支持多 GPU 和 DGX Spark)以及 Strix Halo 上的 ROCm。在用 8 张 L40S 显卡的测试中,它实现了 120 tokens/s 的聚合生成速度和 2000 tokens/s 的预填充速度;该代码在 GPT 5.5/5.6 和 Claude Fable 的强力辅助下开发,并在不链接 GGML 的情况下借鉴了 llama.cpp/GGML 的概念。

rss · GitHub Trending - Daily · 8月4日 17:51

背景: GGUF 是一种二进制格式,它将大模型的权重、分词器数据、架构元数据和量化信息打包在一起,供 llama.cpp 等推理引擎使用。KV 缓存存储注意力机制的键和值以避免重复计算,而压缩后的 KV 缓存使长上下文在本地硬件上变得可行。imatrix(重要性矩阵)是一种量化技术,通过识别异常权重来减少精度损失。DwarfStar 沿袭了 llama.cpp 和 GGML 开辟的道路,但只专注于少数几个模型。

参考链接

标签: #LLM inference, #DeepSeek, #local AI, #Metal, #CUDA


LiveKit Agents:实时语音 AI 智能体开源框架 ⭐️ 8.0/10

LiveKit 发布了 Agents,一个用于构建实时多模态语音 AI 智能体的开源 Python 框架。它集成了语音转文字、大语言模型、文字转语音和实时 API,并支持语义轮次检测和 MCP 等功能。 该框架降低了开发者构建语音 AI 助手的门槛,而这是一个快速增长的 AI 领域。通过提供与 LiveKit 的 WebRTC 媒体服务器兼容的开源基础设施,它支持完全自托管的实时语音智能体部署。 关键技术特性包括用于减少打断的语义轮次检测模型、通过 dispatch API 的内置任务调度、电话(telephony)集成,以及用于与客户端交换数据的 RPC/数据 API。该库可通过 pip 安装,并支持插件扩展,例如 pip install 'livekit-agents[openai,deepgram,cartesia]'

rss · GitHub Trending - Daily · 8月4日 17:51

背景: LiveKit 是一个基于 WebRTC 的开源平台,提供可扩展的多用户会议系统,以及实时视频和音频基础设施。实时语音 AI 智能体通常结合语音识别、大语言模型和语音合成,与用户进行自然对话;LiveKit Agents 旨在通过提供媒体传输、任务调度和模型集成的底层支持,简化此类智能体的构建。

参考链接

标签: #AI agents, #voice AI, #realtime, #framework, #open-source


我国首部 L3/L4 自动驾驶强制性安全国标发布 ⭐️ 8.0/10

工信部组织制定的《智能网联汽车 自动驾驶系统安全要求》(GB 44721—2026)强制性国家标准已发布,拟于 2027 年 7 月 1 日起实施。该标准由此前的推荐性国家标准 GB/T 44721—2024 升级而来,为 L3 级和 L4 级自动驾驶产品确立了统一的安全准入基线。 这是我国首部专门针对 L3/L4 自动驾驶系统的强制性国标,标志着自动驾驶安全从鼓励性要求转向强制性法律约束,将深刻影响行业技术研发、测试验证和产品上市节奏。标准参照了联合国 ADS GTR 和 UN R157 等国际法规,有助于中国车企与国际标准接轨。 标准适用于装备 L3 或 L4 级自动驾驶系统的 M 类、N 类车辆,要求自动驾驶系统的安全性能不低于合格且专注的人类驾驶员,且不得对用户和其他道路使用者构成不合理安全风险。该标准由工信部归口,比亚迪、蔚来、小鹏、吉利、理想、小米汽车以及博世、宝马、奔驰等国内外企业参与了起草。

rss · IT HOME · 8月4日 11:06

背景: SAE J3016 标准将驾驶自动化分为 L0 至 L5 等级,其中 L3 为有条件自动驾驶,驾驶员需随时准备接管;L4 为高度自动驾驶,系统在限定条件下可完全自主驾驶。GB 44721—2026 取代了 2024 年发布的推荐性标准,并参考联合国《自动驾驶系统全球技术法规》和 UN R157 等国际文件,体现了中国在自动驾驶安全监管上与国际接轨的趋势。

参考链接

标签: #autonomous driving, #regulation, #safety standards, #intelligent connected vehicles, #policy


OpenAI 否认苹果诉讼,公布证据 ⭐️ 8.0/10

OpenAI 发布了题为《Apple is getting this wrong》的公开回应,称苹果的诉讼毫无根据,澄清了有关其员工的指控,并分享了内部消息以证明事情的经过。 这一两家 AI 巨头之间的高争议事件可能影响科技公司如何处理员工流动和商业秘密指控。公开反驳可能影响法律程序、竞争格局以及社区对 AI 创新的看法。 该回应特别提到了与员工相关的指控,并包含内部通讯作为证据,暗示争议涉及员工招聘或保密问题。OpenAI 称该诉讼毫无根据,表明其坚定的法律立场。

rss · OpenAI News · 8月3日 22:00

背景: 苹果对 OpenAI 提起诉讼,OpenAI 称该诉讼毫无根据。争议似乎涉及对 OpenAI 员工的指控,OpenAI 选择通过公开回应而非仅在法庭上为自己辩护。随着 AI 人才和技术竞争加剧,大型科技公司之间的法律纠纷并不少见。

标签: #OpenAI, #Apple, #lawsuit, #AI industry, #legal


JFrog 发现 SQLite 严重 CVE 完全是 LLM 生成的垃圾内容 ⭐️ 8.0/10

JFrog 的安全研究揭示了多个备受关注的 SQLite CVE(包括一些被标记为严重的条目)其实完全是由大语言模型编造的。该发现详细记录在 JFrog 博客文章中,并由 LWN 转载,表明这些虚假条目已经混入了漏洞数据库。 这一发现意义重大,因为虚假的 CVE 会让组织浪费时间与资源去调查和修补并不存在的漏洞。当使用 AI 来自动化漏洞分类时,这些虚假条目会使智能体误入歧途,触发不必要的代码修改。 该报告指出,由 LLM 生成的“垃圾”CVE 可能携带严重等级评分,并进入备受关注的数据库中。在自动化环境中,AI 代理可能会尝试定位根本不存在的易受攻击函数、生成补丁或基于不存在的代码推荐修改方案。

rss · LWN.net · 8月3日 14:59

背景: CVE(通用漏洞披露)是一个公开维护的已知安全漏洞列表,安全工具广泛使用它来排定修复优先级。“AI 垃圾内容”指生成式人工智能产出的低质量内容,它们看似合理,但缺乏准确性或意义。近期有学术研究开始探讨 LLM 如何生成令人信服但虚假的 CVE 标识符,这正是 JFrog 在 SQLite 中发现的现象。

参考链接

标签: #LLM, #security, #CVE, #vulnerability databases, #AI safety


NetBSD 11.0 发布,新增 RISC-V 移植 ⭐️ 8.0/10

NetBSD 11.0 作为操作系统第 19 个主版本发布,新增了 RISC-V 移植,改进了 compat_linux 中的 Linux 系统调用兼容性,并增强了 NPF 防火墙。发布说明公开承认一些安全问题仍未解决。 此次发布表明 NetBSD 仍然是 Linux 之外一种相关且可移植的类 Unix 替代方案,并增强了对 Linux 二进制文件的兼容性和防火墙功能。对已知安全问题保持透明的做法为开源项目树立了负责任的榜样。 NetBSD 11.0 是第 19 个主版本,接续 10.1,并添加了 RISC-V 架构移植。compat_linux 子系统现在支持更多 Linux 系统调用,NPF 防火墙也获得了多项改进;尽管存在已知未解决问题,因新报告持续到来,项目组仍选择发布并保持透明。

rss · LWN.net · 8月3日 13:33

背景: NetBSD 是一个免费开源的类 Unix 操作系统,以其对多种硬件的可移植性而闻名。RISC-V 是一种开放指令集架构(ISA),在处理器设计中日益受到欢迎。compat_linux 子系统允许在 NetBSD 上运行 Linux 二进制文件,而 NPF 是 NetBSD 上开发的一种有状态包过滤防火墙。

参考链接

标签: #NetBSD, #Operating Systems, #RISC-V, #Security, #Open Source


NVIDIA 提出世界动作模型,提升机器人操作泛化能力 ⭐️ 8.0/10

NVIDIA 发布技术博客,提出世界动作模型(WAM)作为超越视觉-语言-动作(VLA)模型的机器人操作新范式。该文章强调 WAM 同时学习世界动力学与动作生成,目标是提升策略超越训练示范的泛化能力。 WAM 通过利用学习到的动力学而非仅依赖语义映射,可能让机器人策略零样本迁移到新任务、新机器人和新环境。这直击机器人学习的核心瓶颈,并可能加快通用操作系统的真实部署。 WAM 是具身基础模型,统一了预测性状态建模与动作生成,目标是未来状态和动作的联合分布,而非单独的动作。该方法基于视频世界模型(如采用 Mixture-of-Transformers 架构并在海量视频数据上训练的 NVIDIA Cosmos)构建。

rss · NVIDIA Developer Blog · 8月4日 16:00

背景: 视觉-语言-动作(VLA)模型是一类多模态基础模型,输入文本指令和图像观察,将它们编码为潜在表示,并生成底层机器人动作。但这类模型常常难以泛化到训练示范之外的情境。世界动作模型从预训练的视频生成或世界模型骨干出发,让策略在行动前能够想象可能的未来状态,从而扩展了这一思路。

参考链接

标签: #robotics, #world models, #VLA, #NVIDIA, #AI research


NVIDIA 详解如何用 Kai 调度器在共享 GPU 上运行隔离租户 Kubernetes 集群 ⭐️ 8.0/10

NVIDIA 发布了一篇技术博客,介绍如何使用开源 Kai 调度器在共享 GPU 基础设施上运行相互隔离的租户 Kubernetes 集群。该方法将 Kai 与 vCluster 结合,使每个团队拥有独立控制面,同时共享同一批物理 GPU 资源。 这之所以重要,是因为每个团队单独使用专用集群会浪费 GPU 容量并推高成本,而简单共享一个集群又会带来隔离问题。它为构建共享 ML/AI 基础设施的平台工程师提供了一个兼顾高利用率和强租户边界的实用方案。 Kai 调度器提供拓扑感知的分层 GPU 调度,支持团队级配额和突发分配;vCluster 则提供完整的租户隔离,包括 RBAC、CRD 和集群管理员访问权限。文章还介绍了时间切片、MPS、MIG 和 DRA 等 GPU 共享技术,每种技术都有不同的权衡。

rss · NVIDIA Developer Blog · 8月3日 16:00

背景: Kubernetes 默认将 GPU 视为不可分割的单一资源,因此要让多个 Pod 共享一块 GPU,需要借助时间切片、MIG、MPS 或动态资源分配(DRA)等机制。Kai 调度器是 NVIDIA 专为 GPU 加速 AI/ML 工作负载设计的开源批处理调度器,增加了 gang scheduling 和分层配额等能力。vCluster 等虚拟集群技术可以在一个物理集群之上创建多个相互隔离的 Kubernetes 控制面,从而实现多租户,而无需单独采购基础设施。

参考链接

标签: #Kubernetes, #GPU, #Multi-tenancy, #Scheduler, #Infrastructure


美团开源 LoHoSearch:用知识图谱校准搜索智能体能力评测 ⭐️ 8.0/10

美团开源了 LoHoSearch——一个知识图谱驱动的搜索智能体评测基准,用于评估长程搜索与上下文管理能力。该基准直击 BrowseComp 等现有评测的饱和问题:顶尖模型准确率已从约 30%攀升至 90%以上。 LoHoSearch 提供了更加严苛的评测标准:即使最强模型准确率也仅为 34.74%。这有助于 AI 生态更可靠地校准智能体能力,避免因基准饱和而得出过早的超越人类等结论。 根据论文和数据集页面,最强模型在 LoHoSearch 上仅取得 34.74%准确率,现有上下文管理策略的增益(最多+6.8%)远小于此前基准。该数据集已在 Hugging Face 上以 meituan-longcat/LoHoSearch 名称公开。

rss · 美团 Blog · 8月4日 17:51

背景: 搜索智能体是一类能在网络上浏览并寻找难以获取信息的 AI 系统,OpenAI 的 BrowseComp(含 1,266 道题)等基准正是用来衡量这种能力。随着这些基准逐渐饱和——顶尖模型准确率已超过 90%——其区分模型能力的作用随之减弱。LoHoSearch 通过知识图谱驱动的方式自动生成任务,从而提供超越人类难度上限的评测。

参考链接

标签: #search agents, #benchmark, #knowledge graph, #AI evaluation, #open source


MineExplorer:首个开放世界长程任务评测基准揭示多模态大模型能力短板 ⭐️ 8.0/10

美团 LongCat 团队推出了 MineExplorer,这是首个在开放世界中评测分钟级长程任务的基准。它系统性地衡量多模态大语言模型(MLLM)在需要长期规划且包含隐藏前置条件的任务中的表现,并揭示了顶级模型的能力断层。 MineExplorer 填补了 AI 智能体评测的一个重要空白,将评测从短时、边界明确的任务扩展到现实、开放的场景。该基准有望引导多模态智能体向更实用的方向发展,推动其在真实世界应用中的能力提升。 该基准剔除了过度依赖 Minecraft 特有知识的原子任务,以更好地反映通用的开放世界推理能力。它以 Minecraft 为测试平台,重点关注包含隐藏前置条件、持续时间达分钟级的长程任务。

rss · 美团 Blog · 8月4日 17:51

背景: 多模态大语言模型(MLLM)将语言与视觉等模态结合,以处理多样的输入。基准测试是用于比较模型能力的标准化测试,而 Minecraft 等开放世界环境正越来越多地被用于模拟真实世界的复杂性。长程任务要求智能体在多步操作中持续保持目标,并应对意外情况,这是自主智能体的核心挑战。以往的基准多聚焦于单步或短时任务,MineExplorer 正是为了弥补这一空白而提出的。

参考链接

标签: #multimodal, #benchmark, #open-world, #agents, #evaluation


美团正式开源 LongCat-2.0:1.6T 参数智能体编程模型 ⭐️ 8.0/10

美团正式开源了 LongCat-2.0,这是一个面向智能体编程的 1.6T 参数混合专家模型,平均激活约 48B 参数,并同步开放了适配国产 GPU 的推理代码。 这是中国头部科技公司在开源领域的重大动作,可能加速大规模智能体编程模型的落地应用。其新颖的 LongCat 稀疏注意力与 N-gram 嵌入设计,也可能影响未来大模型架构研究,尤其在超长上下文和国产 GPU 部署方面。 该模型引入了 LongCat 稀疏注意力(LSA),这是对 DeepSeek 稀疏注意力的改进,采用更轻量的索引器以高效处理长达 1M token 的上下文;同时引入 N-gram 嵌入以增强 token 级表示。模型在海量 1M 上下文数据上训练,发布内容还包含针对国产 GPU 优化的推理代码。

rss · 美团 Blog · 8月4日 17:51

背景: LongCat-2.0 是一个混合专家(MoE)模型,意味着每个 token 只激活其 1.6T 总参数中的一小部分。智能体编程(Agentic coding)指的是大模型能够自主完成现实软件任务中的规划、编写、调试和执行代码。稀疏注意力机制(如 LSA)通过只关注部分 token 来降低长上下文处理的计算成本,其设计借鉴了 DeepSeek 稀疏注意力等先前工作。N-gram 嵌入在嵌入层捕捉多词组合模式,有助于提升代码理解能力。此次开放国产 GPU 推理代码具有特殊意义,因为中国正在积极发展国产 AI 加速器,以替代 NVIDIA 硬件。

参考链接

标签: #LLM, #Agentic Coding, #Sparse Attention, #Open Source, #MoE


LongCat 开源 VitaBench 2.0:长期动态智能体评测新基准 ⭐️ 8.0/10

美团 LongCat 团队开源了 VitaBench 2.0,这是一个用于评估大语言模型智能体在长期、动态用户互动中个性化与主动性能力的基准。该基准包含 56 位用户、819 个子任务、66 个工具和 2000 多条细粒度偏好。 长期用户建模和主动行为在智能体评测中尚未得到充分探索,VitaBench 2.0 通过贴近真实、按时间排序的任务填补了这一空白。它有望成为构建个性化 AI 助手的研发人员常用的标准基准。 VitaBench 2.0 的任务按时间序列为每个用户组织,以捕捉偏好跨会话的变化。值得注意的是,LinkedIn 上的一篇分析发现,添加记忆反而可能让领先的智能体表现更差,因为真实的隐式偏好往往杂乱、依赖上下文且相互矛盾。

rss · 美团 Blog · 8月4日 17:51

背景: VitaBench 2.0 基于 VitaBench 1.0 构建。VitaBench 1.0 于 ICLR 2026 发布,取材于外卖配送、到店消费和在线旅游等日常生活场景,提供了包含 66 个工具的复杂生活服务模拟环境。新版本将重点转向长期动态用户建模,强调个性化和主动性,而不是单纯完成孤立任务。

参考链接

社区讨论: LinkedIn 上题为《记忆让领先者在 VitaBench 2.0 上表现更差》的评论文章指出,给领先的智能体增加记忆反而可能损害其成绩,因为真实世界中的偏好往往跨会话相互矛盾。作者还提到该基准有意控制工具和指令复杂度,继承了 VitaBench 1.0 的设计选择。

标签: #LLM, #benchmark, #AI agents, #personalization, #evaluation


RagTester 实现 RAG 系统自动化端到端测试 ⭐️ 8.0/10

该论文介绍了 RagTester,一个面向检索增强生成(RAG)系统的自动化端到端测试框架。它在 24 种 LLM 与嵌入模型配置上生成测试,执行了 72,000 次测试运行,检测出 21,633 个失败,并在 24 个配置中的 20 个上优于基线。 RAG 系统被广泛部署,但其可靠性取决于检索、生成和提示构造之间的复杂交互。RagTester 通过支持部署前系统化、自动化的故障检测,填补了关键的质量保障空白,帮助工程师评估和比较不同的 RAG 配置。 RagTester 的测试生成策略针对复杂段落、不支持查询和文档覆盖率标准,并使用 LLM 作为裁判来评估答案。检测到的失败包括检索不准确、不支持的回答、对检索上下文使用不完整,以及难以理解复杂段落等。

rss · arXiv cs.AI · 8月4日 04:00

背景: 检索增强生成(RAG)是一种 AI 框架,它将信息检索系统与大型语言模型相结合,使模型能够访问训练数据之外的外部知识。LLM-as-a-judge 是一种评估方法,其中语言模型根据定义的评分标准来评估另一系统输出的质量。RAG 测试颇具挑战性,因为失败可能源于任何组件或它们的交互,因此自动化的、面向覆盖率的测试生成非常有价值。

参考链接

标签: #RAG, #LLM testing, #quality assurance, #retrieval-augmented generation, #evaluation


生产级 GitHub Copilot 研究揭示智能体编码模式 ⭐️ 8.0/10

研究人员发布了首个生产规模的智能体编码(agentic coding)工作负载特征分析,基于 2026 年 6 月 GitHub Copilot 的抽样追踪数据,覆盖 320 万用户、1300 万会话、7.61 亿次 LLM 调用和 95 万亿 token。研究量化了轮次内 KV 缓存命中率平均约 90%,跨轮次边界则降至 55%。 这是首个在生产规模下观察 AI 编码智能体如何实际消耗 LLM 推理资源的实证研究,挑战了当前推理服务系统的既有假设。它为系统和机器学习研究者提供了设计面向智能体的基础设施所需的具体数据,尤其是在 KV 缓存复用和空闲时间资源编排方面。 研究发现,智能体编码会话由稀疏的用户发起轮次组成,每一轮会展开为几乎总是伴随工具执行的自主智能体 LLM 调用循环。模型切换或上下文压缩(context compaction)会大幅使 KV 缓存失效,而一个轻量级空闲时间预测器能捕获轮次边界总空闲时间的 86%–90%。

rss · arXiv cs.AI · 8月4日 04:00

背景: Agentic coding(智能体编码)指 AI 工具从自动补全转向自主执行高层指令,作为智能体将 LLM 推理与工具调用交替进行。在推理过程中,LLM 使用 KV 缓存存储已计算过的键和值向量,避免重复计算并加速 token 生成,因此高效的缓存管理对生产级服务至关重要。在长时间的智能体会话中,对话历史可能超出模型的上下文窗口,上下文压缩通过摘要或截断来控制历史长度,但这会限制内存占用,也可能破坏已缓存的 KV 状态。

参考链接

标签: #AI agents, #LLM systems, #workload characterization, #GitHub Copilot, #ML infrastructure