Skip to the content.

从 150 条内容中筛选出 25 条重要资讯。


  1. GPT-5.6 解决凸优化领域 30 年猜想 ⭐️ 9.0/10
  2. 首次在宜居带类地行星上探测到大气层 ⭐️ 9.0/10
  3. 首次实现 TMDC 纳米管手性可控合成 ⭐️ 9.0/10
  4. 科学家首次观测到电子时空不确定性极限 ⭐️ 9.0/10
  5. 美团发布 LongCat-2.0:国产算力训练万亿参数模型 ⭐️ 9.0/10
  6. LG 显示器通过 Windows Update 静默安装软件 ⭐️ 8.0/10
  7. Stack Overflow 因 AI 和政策问题而下滑的数据可视化 ⭐️ 8.0/10
  8. TP-Link Kasa 摄像头通过 UDP 泄露 GPS 位置长达 6 年 ⭐️ 8.0/10
  9. Build-Your-Own-X:重建技术的精选教程库 ⭐️ 8.0/10
  10. GitHub 发布官方 Copilot SDK,支持多平台 ⭐️ 8.0/10
  11. Open Interpreter 为 Kimi K3 等低成本开源模型优化 ⭐️ 8.0/10
  12. 通过 WebAssembly 在浏览器中运行 Firefox ⭐️ 8.0/10
  13. 阿里云发布 M890 超节点,支撑十万亿参数 MoE 模型 ⭐️ 8.0/10
  14. 《半秒》一书详述 XZ 后门攻击 ⭐️ 8.0/10
  15. 开源模型网络能力差距缩小至 4-7 个月 ⭐️ 8.0/10
  16. LongCat 开源 VitaBench 2.0:长期动态智能体新基准 ⭐️ 8.0/10
  17. 美团 WBench:首个交互式世界模型评测基准 ⭐️ 8.0/10
  18. 美团六篇 ACL 2026 论文聚焦大模型评测、推理与优化 ⭐️ 8.0/10
  19. LLMs 表现出偏爱其创造者的隐藏偏见 ⭐️ 8.0/10
  20. 卡普空将路径追踪引入 RE 引擎,用于两款游戏 ⭐️ 7.5/10
  21. 运河底部遗忘计算机引发架构辩论 ⭐️ 7.0/10
  22. Zilog Z80 庆祝其 50 年影响力 ⭐️ 7.0/10
  23. 学习实用的 SQLite 工作流技巧 ⭐️ 7.0/10
  24. PostHog 平台通过 AI 可观测性实现自驱产品 ⭐️ 7.0/10
  25. Hallmark:为 AI 编程工具设计的反 AI 俗套技能 ⭐️ 7.0/10

GPT-5.6 解决凸优化领域 30 年猜想 ⭐️ 9.0/10

据报道,用户通过向 GPT-5.6 输入一个提示词,生成了一个证明,解决了凸优化理论中一个长达 30 年的空白,具体涉及球形域上凸 Lipschitz 函数优化时间复杂度的猜想。 如果经过验证,这表明大语言模型能够贡献新颖的数学证明,可能加速研究进程,并将数学家的角色转向更具创造性的工作。这也再次引发了关于 AI 是否具备真正推理能力的争论。 该猜想涉及球形域上 Lipschitz 函数凸优化问题的时间复杂度上界(球形域限制并非实质性限制)。据称该证明由 GPT-5.6 Sol Pro(而非 Ultra)生成,暗示了多智能体系统架构。社区正在等待验证。

hackernews · mbustamanter · 7月18日 13:00 · 社区讨论

背景: 凸优化是数学优化的一个子领域,研究在凸集上最小化凸函数的问题,许多问题有多项式时间算法。这次 30 年的猜想可能涉及特定函数类在这种优化中的复杂度,球形域是几何优化中的常见设定。

参考链接

社区讨论: 社区用户既兴奋又怀疑,讨论了对数学研究的潜在影响,并指出该猜想虽然小众但确实是一个真正的贡献。一些用户注意到模型版本差异(Sol Pro 对比 Ultra),并争论 AI 是否会让初级数学家过时,另一些用户则将其与其他 AI 辅助证明进行比较。

标签: #AI, #mathematics, #convex optimization, #GPT, #problem-solving


首次在宜居带类地行星上探测到大气层 ⭐️ 9.0/10

天文学家利用詹姆斯·韦伯太空望远镜的发射光谱技术,在距离地球 48 光年的红矮星宜居带内,首次在岩石系外行星 LHS 1140b 上探测到大气层。 这标志着首次在宜居带内一颗类似地球的岩石行星上确认存在大气层,是寻找地外生命的重要里程碑。它也展示了詹姆斯·韦伯太空望远镜表征潜在宜居系外行星的能力。 LHS 1140b 的质量是地球的 6.38 倍,每 24.7 天绕其恒星公转一圈。这一探测结果排除了迷你海王星的可能性,表明它拥有岩石表面和一层可能富含氦的稀薄大气。

hackernews · neversaydie · 7月17日 14:06 · 社区讨论

背景: 宜居带是指恒星周围液态水可能存在于行星表面的区域。红矮星比太阳温度更低、活动更剧烈,常常会剥离近距离行星的大气层。韦伯望远镜的发射光谱技术测量行星运行到恒星后方时自身发出的光,从而揭示大气成分。此前的研究尚未在宜居带内的岩石系外行星上确认存在大气层。

参考链接

社区讨论: 评论指出红矮星环境恶劣,但 LHS 1140b 仍能保有大气层;有用户引用 arXiv 论文证实它并非迷你海王星。其他人则讨论了推进系统和未来望远镜,对这一发现表示乐观。

标签: #exoplanets, #astronomy, #atmosphere, #habitable zone, #JWST


首次实现 TMDC 纳米管手性可控合成 ⭐️ 9.0/10

浙江大学领衔的国际团队首次实现了过渡金属二硫化物(TMDC)纳米管的手性可控合成,利用氮化硼纳米管作为模板,选择性得到扶手椅型纳米管。这一突破于 2025 年 7 月 17 日发表在《科学》杂志上,解决了该领域三十余年的核心难题。 扶手椅型 TMDC 纳米管具有更低的电子有效质量和更高的载流子迁移率,非常适合制造纳米级晶体管和高速电子器件。这项工作提供了一种通用的合成方法,可能加速下一代纳米电子学和光电子学的发展。 团队使用氮化硼纳米管作为模板,让 TMDC 材料(如二硫化锡、二硫化钼、二硫化钨)在空心通道内生长。以二硫化锡为例,扶手椅型纳米管占比最高可达 84%。机理研究显示,TMDC 优先在模板内壁生长出锯齿形纳米带,随后在限域作用下卷成扶手椅型纳米管,并通过原位透射电镜实时拍摄得到验证。

rss · IT HOME · 7月18日 14:53

背景: TMDC 纳米管是具有独特量子现象的一维材料,于 1992 年被首次发现。但控制其手性——原子晶格沿管轴扭转的方式——一直是长期挑战,因为手性决定电子性质(金属性或半导体性)。以往方法缺乏选择性,得到的是手性混合物。氮化硼纳米管是绝缘、化学性质稳定的模板,可耐高温。

参考链接

标签: #materials science, #nanotechnology, #TMDC, #chiral control, #synthesis


科学家首次观测到电子时空不确定性极限 ⭐️ 9.0/10

德国雷根斯堡超快纳米成像中心与马克斯·普朗克研究所的研究人员首次实验观测到一个新的基本极限——被称为“时空极限”——它阻止了同时精确测量电子位置及其运动时间,类似于海森堡不确定性原理。该成果于 2026 年 7 月 3 日发表在《自然·光子学》上。 这一发现拓展了对量子力学的基本理解,揭示了电子在时间与空间精度之间存在权衡关系。它可能影响未来的超快电子学、量子信息处理以及原子尺度化学反应控制等技术。 利用具有阿秒时间分辨率的光波驱动扫描隧道显微镜,研究团队测量了电子通过势垒的隧穿过程,发现提高时间分辨率会导致电子波包空间展宽。他们还对银表面的单个铜原子进行了成像,实现了阿秒时间分辨率与埃尺度空间分辨率的结合。

rss · IT HOME · 7月18日 10:52

背景: 海森堡不确定性原理指出粒子的位置与动量无法同时精确已知,但此前位置与时间之间不存在这种基本极限。电子在阿秒(10^-18 秒)时间尺度上运动,远快于原子或分子,因此需要超快技术来观测其动力学。光波驱动扫描隧道显微镜将超快激光脉冲与原子分辨率的扫描隧道显微镜结合,以捕捉电子运动。

参考链接

标签: #physics, #quantum mechanics, #uncertainty principle, #ultrafast science, #scanning tunneling microscopy


美团发布 LongCat-2.0:国产算力训练万亿参数模型 ⭐️ 9.0/10

美团发布了 LongCat-2.0,总参数 1.6 万亿,平均激活参数约 480 亿,在五万余张国产算力芯片上完成全流程训练与推理,原生支持百万 token 上下文,专为 Agentic Coding 任务优化。 作为业界首个在国产算力集群上完成全流程训练与推理的万亿参数模型,LongCat-2.0 标志着中国 AI 基础设施自主可控的重大突破。其对 Agentic Coding 的优化可能极大加速软件开发自动化。 该模型采用 MoE 架构,创新性地引入了 LongCat 稀疏注意力(LSA)机制和 N-gram Embedding,以提升长上下文处理效率和 token 级表示能力。预训练数据量超过 35 万亿 tokens。

rss · 美团 Blog · 7月18日 17:00

背景: Agentic Coding 是指利用 AI 智能体自主执行多步软件开发任务,如代码生成、调试和测试。LongCat-2.0 的架构专门针对此类任务设计,以高效处理长代码上下文。国产算力集群使用中国自主研发的 AI 芯片,减少对外部硬件的依赖。该模型的 LongCat 稀疏注意力和 N-gram Embedding 是提升长序列处理和代码理解能力的新技术。

参考链接

标签: #大模型, #国产算力, #Agentic Coding, #万亿参数, #美团


LG 显示器通过 Windows Update 静默安装软件 ⭐️ 8.0/10

发现 LG 显示器通过 HDMI 连接时,会触发 Windows 自动安装并运行 LG 软件(如 On Screen Control),且未经用户同意,这利用的是 Windows Update 的驱动程序推送机制。 这引发了严重的安全和隐私担忧,因为该软件以完整系统权限运行,随系统启动,并可访问互联网。同时暴露了 Windows Update 信任模型中的系统性缺陷,任何硬件厂商都可能借此推送不需要的软件。 只要通过 HDMI 连接 LG 显示器,该软件就会自动安装,即使之前已连接过。可通过组策略或设备安装设置禁用自动下载制造商应用来解决。

hackernews · baranul · 7月18日 10:21 · 社区讨论

背景: Windows Update 可以推送来自硬件制造商的驱动程序更新及相关软件。HDMI 连接包含显示数据通道(DDC),允许显示器与 PC 之间通信。该通道被用于触发 LG 软件的下载和安装。

参考链接

社区讨论: 社区对此感到愤怒,许多评论称其为‘恶意软件’,并指责 LG 和微软。有人提供了通过组策略的解决方案。部分用户认为真正的责任在于微软允许此类自动安装。

标签: #security, #privacy, #windows, #malware, #hardware


Stack Overflow 因 AI 和政策问题而下滑的数据可视化 ⭐️ 8.0/10

Stack Exchange 数据浏览器上的一个可视化图表显示 Stack Overflow 活动急剧下降,社区讨论将其归因于 ChatGPT 等 AI 驱动的替代方案以及平台严格的社区政策。 这一趋势标志着开发者寻求帮助的方式发生了根本性转变,可能削弱 Stack Overflow 等问答平台的长期主导地位,同时突显 AI 工具日益增长的影响力。 该图表追踪了用户活动随时间的变化,显示 2022 年底 ChatGPT 推出后出现显著下降,但评论也指出,早在 2021 年 Stack Overflow 被 Prosus 收购后,下降趋势就已开始。

hackernews · secretslol · 7月18日 11:12 · 社区讨论

背景: Stack Overflow 是一个广受欢迎的程序员问答平台,用户可以提问和回答技术问题。近年来,该网站因严格的审核政策(不鼓励新用户)而受到批评,而 ChatGPT 等 AI 聊天机器人则能提供即时答案,且没有社交摩擦。

社区讨论: 评论者普遍将用户流失归咎于 Stack Overflow 自身的政策,他们分享了问题被标记为重复或不合适的经历,并指出 AI 工具从不羞辱用户。一些人还认为 2021 年被 Prosus 收购也是因素之一。

标签: #stackoverflow, #AI impact, #community management, #Q&A platforms, #developer tools


TP-Link Kasa Spot EC71 摄像头的一个漏洞被披露,显示设备通过未认证的 UDP 数据包泄露 GPS 坐标。该漏洞存在了六年,直到固件版本 2.4.1 才被修复。 该漏洞暴露了用户家中的 GPS 坐标,对数百万 Kasa 摄像头用户构成严重的隐私风险。它凸显了廉价物联网设备普遍存在的安全问题,这些设备常依赖不安全的协议。 该漏洞编号为 CVE-2026-9770 和 CVE-2026-13230,允许同一本地网络上的任何设备在无需认证的情况下查询摄像头的 GPS 位置。从互联网利用此漏洞需要摄像头通过 DMZ 暴露,这对普通用户来说并不常见。

hackernews · BadChemical · 7月17日 21:42 · 社区讨论

背景: 许多物联网设备(包括 TP-Link Kasa 产品)使用 UDP 进行本地设备发现,因其开销低。然而,未认证的 UDP 服务如果保护不当,可能会泄露敏感数据。漏洞报告者还指出,在测试过程中一次固件更新导致设备变砖,引发了对 TP-Link 质量控制的担忧。

参考链接

社区讨论: 社区意见不一:有人认为风险较低,因为利用需要本地网络访问;而另一些人强调物联网设备绝不应通过未认证的协议传输敏感数据。几条评论质疑其严重性,指出已进入局域网的黑客本就可以推断位置。此外,有评论者称该报告疑似 AI 生成,对其可信度提出了质疑。

标签: #IoT, #security, #vulnerability, #privacy, #TP-Link


Build-Your-Own-X:重建技术的精选教程库 ⭐️ 8.0/10

CodeCrafters 的 ‘build-your-own-x’ 仓库已成为广受认可的逐步指南汇编,涵盖从数据库到操作系统等各种技术的从零构建。 该资源帮助开发者通过实际构建技术来获得深刻理解,超越理论知识。它是软件工程师掌握核心概念的最佳学习工具之一。 该仓库包含超过 50 个类别,包括 3D 渲染器、神经网络、Git、Docker 等,每个类别都链接到编写良好的外部教程。

rss · GitHub Trending - Daily · 7月18日 17:00

背景: 从零开始构建是一种行之有效的教学方法,灵感来自 Richard Feynman 的原则:’我无法创造的东西,我就无法理解。’ 该仓库汇聚了多个领域的这类实践项目,方便开发者查找并跟随学习。

标签: #learning, #software engineering, #open source, #tutorials


GitHub 发布官方 Copilot SDK,支持多平台 ⭐️ 8.0/10

GitHub 正式发布了多平台 SDK,用于将 Copilot Agent 集成到自定义应用和服务中,包已发布在 npm、PyPI、NuGet、Go 和 Rust 以及 Java 上。 该 SDK 允许开发者将 Copilot 的代理工作流直接嵌入到自己的工具中,显著扩展了 AI 辅助开发的范围,并实现了更强大、自定义的自动化。 该 SDK 暴露了 Copilot CLI 背后相同的经过生产测试的代理运行时,可处理规划、工具调用和文件编辑。它支持 Node.js/TypeScript、Python、Go、.NET、Rust 和 Java。

rss · GitHub Trending - Daily · 7月18日 17:00

背景: GitHub Copilot 是一个 AI 结对编程工具,提供代码建议。Copilot Agent 模式使其能够自主规划并执行多步骤任务。该 SDK 让开发者能够以编程方式将同样的代理能力集成到自己的应用中。

参考链接

标签: #copilot, #sdk, #github, #agent, #developer-tools


Open Interpreter 为 Kimi K3 等低成本开源模型优化 ⭐️ 8.0/10

Open Interpreter 是一个从 OpenAI Codex 分支出来的编码代理,现已重新实现以支持 Kimi K3 模型,并基于 Rust 构建的 harness 以获得最佳性能。它现在提供多种 harness 模拟,包括 Kimi Code 和 Claude Code,用户可在不同代理行为间切换。 该项目使开发者能够利用 Kimi K3(2.8 万亿参数)等强大的开源模型进行低成本的代码生成与执行,从而普及先进的 AI 编码助手功能。它提供与 ACP 兼容的灵活替代方案,增强了开源生态系统。 Open Interpreter 支持多种 harness,包括 native、Claude Code、Kimi Code 和 SWE-agent 等,各自针对不同模型优势优化。它兼容 ACP(Agent Client Protocol),可在 VS Code 等编辑器中使用,macOS、Linux 或 Windows 上通过一条命令即可安装。

rss · GitHub Trending - Daily · 7月18日 17:00

背景: Open Interpreter 是一个开源编码代理,可在本地运行,执行代码、管理文件和浏览网页。它是 OpenAI Codex 的一个分支,被重新设计以高效运行于低成本、开放权重的模型,例如 Kimi 发布的 2.8 万亿参数旗舰模型 Kimi K3。该项目强调通过 harness 模拟来复制不同基础模型上专业编码代理的性能。

参考链接

标签: #coding agent, #open-source, #AI, #low-cost models


通过 WebAssembly 在浏览器中运行 Firefox ⭐️ 8.0/10

Puter 成功将整个 Firefox 浏览器编译为 WebAssembly,使其能够运行在另一个浏览器标签页中。该项目使用了 Anthropic 的 Claude AI 和 Wisp 协议来处理网络代理。 这一成就展示了 WebAssembly 的卓越可移植性,证明即使是完整的网页浏览器也能在另一个浏览器内运行。虽然目前不适用于日常使用,但它拓展了浏览器内应用和沙箱执行的可能性。 该项目选择 Firefox/Gecko 是因为其强大的单进程支持。消耗了估计价值 25,000 美元的 Claude Opus 和 Fable 代币,但由于订阅计划实际花费更少。所有网络流量通过 Wisp 协议代理到 Puter 的服务器,并支持端到端加密。

rss · Simon Willison · 7月16日 23:34

背景: WebAssembly (Wasm) 是一种二进制指令格式,允许用 C/C++ 等语言编写的代码以接近原生速度在网页浏览器中运行。将 Firefox 这样的完整浏览器编译为 WebAssembly 是一项艰巨的工程任务,因为浏览器引擎非常复杂。Puter 是一个隐私优先的个人云平台。Wisp 协议是一种低开销的方法,用于通过单个 WebSocket 连接代理 TCP 和 UDP 套接字,从而为浏览器中运行的代码提供网络访问。

参考链接

社区讨论: Hacker News 社区称赞该项目,但指出演示的服务器基础设施因突然的流量而紧张,需要扩容。

标签: #WebAssembly, #Firefox, #Browser, #Engineering, #AI-assisted development


阿里云发布 M890 超节点,支撑十万亿参数 MoE 模型 ⭐️ 8.0/10

阿里云宣布推出灵骏真武 M890 超节点实例,这是其首次通过公共云提供超节点形态的 AI 算力服务,目前在内蒙古乌兰察布开放邀测。该实例支持 FP8/FP4 低精度计算,一台即可承载十万亿参数级 MoE 大模型的推理。 此次发布标志着公共云 AI 基础设施的重大突破,使企业无需自建集群即可训练和部署超大规模 MoE 模型,有望加速十万亿参数模型在各行各业的生产落地。 M890 通过 ICN Switch 1.0 芯片将互联规模从 16 卡提升至 64 卡,卡间带宽达 800GB/s。在智能驾驶、具身智能等场景中,训练性能相比上一代真武 810E 提升三倍。

rss · IT HOME · 7月18日 12:47

背景: Mixture-of-Experts(MoE)是一种神经网络架构,它使用多个“专家”子网络和一个门控机制,每次只激活部分专家,从而在不显著增加计算成本的前提下扩大模型容量。FP8 和 FP4 是低精度浮点格式,可减少内存占用并加速推理,同时保持可接受的准确率。ICN Switch 是阿里云自研的高带宽 GPU 互连技术。

参考链接

标签: #Alibaba Cloud, #AI infrastructure, #large model inference, #super node, #MoE


《半秒》一书详述 XZ 后门攻击 ⭐️ 8.0/10

Adrian Mastronardi 发布了《半秒》一书,该书免费提供,以时间顺序讲述了 2024 年 XZ 后门攻击事件,涵盖了针对维护者的社会工程学攻击以及工程师的偶然发现。 这本书成为了供应链安全和社会工程学方面的宝贵教育资源,帮助开源社区理解并防范类似攻击。 XZ Utils 中的后门由 Andres Freund 发现,可通过 OpenSSH 实现远程代码执行。本书采用非商业、禁止演绎的 CC 许可协议。

rss · LWN.net · 7月18日 16:52

背景: 2024 年 3 月,在 Linux 广泛使用的压缩工具 XZ Utils 中发现了一个后门。攻击者通过多年的社会工程学手段获得信任,并贡献了恶意代码。该后门针对 OpenSSH,可实现远程代码执行。它仅因一位工程师的‘半秒’好奇心而被偶然发现。

参考链接

标签: #security, #supply chain, #open source, #social engineering, #backdoor


开源模型网络能力差距缩小至 4-7 个月 ⭐️ 8.0/10

英国 AI 安全研究所评估了领先的开源权重模型 GLM-5.2 和 DeepSeek V4-Pro 在网络任务上的表现,发现它们仅落后前沿闭源模型 4 到 7 个月,而 2025 年初这一差距为 6 到 10 个月。 这一差距的缩小挑战了闭源模型在安全性上的优势假设,可能影响 AI 治理政策,因为开源模型在网络风险相关任务上的能力正在提升。 AISI 从 2025 年 2 月到 6 月测量了能力滞后时间,显示稳定下降,从 6-10 个月降到 6 月的 4-7 个月。评估的两个开源模型是 GLM-5.2(MIT 许可证,1M 上下文)和 DeepSeek V4-Pro(MoE 架构,1.6 万亿参数,激活 490 亿)。

rss · AISI Blog · 7月17日 00:00

背景: AISI 是英国 AI 安全研究所,负责评估前沿 AI 模型。开源权重模型允许公众访问模型权重,便于微调和部署,而闭源模型仅通过 API 访问。网络能力指漏洞发现和漏洞利用开发等技能,可能带来滥用风险。

参考链接

标签: #AI safety, #model evaluation, #open source models, #cyber capabilities, #frontier models


LongCat 开源 VitaBench 2.0:长期动态智能体新基准 ⭐️ 8.0/10

美团 LongCat 团队开源了 VitaBench 2.0,这是首个在真实、多轮交互场景下评估大语言模型智能体长期动态用户建模能力的基准。 这填补了智能体评估中的一个关键空白,因为现有基准主要关注单轮推理和工具使用,忽略了在数天或数周内推断和更新用户偏好的挑战。VitaBench 2.0 能够促进开发可在长期内维护一致用户模型的个性化与主动性智能体。 该基准要求智能体在跨越数天、数周或数月的分散对话和行为中推断、利用和更新用户偏好,任务被置于演变的用户轨迹中而非孤立提示。VitaBench 2.0 已在 GitHub 开源,并有配套论文详细介绍。

rss · 美团 Blog · 7月18日 17:00

背景: 大语言模型智能体是能够通过推理、规划和使用工具自主执行任务的 AI 系统。现有的基准如 SWE-bench 或 ToolBench 评估智能体在孤立任务上的表现,但实际应用要求智能体理解并适应用户随时间演变的偏好。VitaBench 2.0 通过模拟长期用户交互填补了这一空白。

参考链接

社区讨论: 新闻中未提供社区评论,但该基准在 GitHub 上的开源发布很可能会吸引从事个性化智能体和用户建模研究人员的兴趣。

标签: #Benchmark, #LLM, #AIAgent, #UserModeling, #Personalization


美团 WBench:首个交互式世界模型评测基准 ⭐️ 8.0/10

美团 LongCat 团队提出并开源了 WBench,这是首个面向交互式视频世界模型的系统性多轮评测基准。 WBench 填补了世界模型从被动视频生成迈向主动交互这一关键评估空白,对于推动自主决策和机器人技术发展至关重要。该基准将为社区提供标准化测试平台,有望加速相关研究。 WBench 被誉为世界模型的“CT 扫描仪”,能精确定位当前模型从被动观看到主动交互过程中卡住的环节。该基准已开源,方便研究人员系统评估和比较不同模型。

rss · 美团 Blog · 7月18日 17:00

背景: AI 中的世界模型是指学习环境内部表示并模拟环境随时间如何因动作而变化的系统,对于规划和推理至关重要。交互式视频世界模型进一步实现实时、因果且条件于动作的视频生成,是迈向真正自主智能体的一步。然而,此前缺乏系统性的评测基准来评估这种交互能力,阻碍了进展。WBench 通过提供多轮评估框架填补了这一空白。

参考链接

标签: #world models, #benchmark, #interactive video, #Meituan, #AI evaluation


美团六篇 ACL 2026 论文聚焦大模型评测、推理与优化 ⭐️ 8.0/10

美团发布了一篇博客文章,总结其被 ACL 2026 收录的六篇论文,涵盖大模型评测、复杂流程推理、竞赛级数学优化、强化学习优化以及生成式推荐等领域。 这展示了业界在提升大模型能力方面的积极研究,尤其是在评测方法、推理过程以及新型推荐范式上,这些对于部署可靠且高效的 AI 系统至关重要。 这六篇论文涵盖用于数学推理的过程奖励模型、直接推理优化,以及将推荐视为序列生成任务的生成式推荐系统等主题。

rss · 美团 Blog · 7月18日 17:00

背景: ACL(计算语言学协会)是 NLP 领域的顶级会议。过程奖励模型(PRM)提供步骤级别的反馈来改进推理。生成式推荐系统利用 Transformer 架构,将检索、排序和推理统一在单一模型中。

参考链接

标签: #NLP, #Large Language Models, #Reasoning, #Reinforcement Learning, #Recommendation


LLMs 表现出偏爱其创造者的隐藏偏见 ⭐️ 8.0/10

这种隐藏偏见威胁到 AI 系统的客观性和可信度,尤其是在它们被部署到各行业的决策、搜索和咨询角色中时。 这种偏见并非显式编程所致,而是源于训练数据、模型架构或对齐过程,使得在没有专门审计的情况下难以检测和缓解。

reddit · r/OpenAI · /u/EchoOfOppenheimer · 7月18日 08:48

背景: 像 Claude 这样的大型语言模型在庞大文本语料库上训练,并通过人类反馈的强化学习进行微调以符合人类偏好。然而,近期研究表明,LLMs 可能发展出微妙的、非预期的偏见,偏向于其母公司,这引发了对 AI 对齐和公平性的担忧。

参考链接

标签: #AI bias, #LLM fairness, #AI alignment, #ethical AI


卡普空将路径追踪引入 RE 引擎,用于两款游戏 ⭐️ 7.5/10

卡普空的 RE ENGINE 团队成功将实时路径追踪集成到两款已发布游戏《PRAGMATA》和《Resident Evil Requiem》中,相关细节在 NVIDIA 博客的问答中进行了阐述。 这标志着一项重要的工程成就,表明完整的路径追踪可以部署在实时游戏引擎中用于商业游戏,有望提升游戏的视觉保真度标准。 该实现需要克服去噪和性能优化等挑战,每款游戏因其不同的视觉风格而采用了定制化的解决方案。

rss · NVIDIA Developer Blog · 7月16日 22:59

背景: 路径追踪是一种模拟光物理行为的渲染技术,可生成逼真的图像,但计算成本高,传统上用于离线渲染。借助 NVIDIA RTX 系列等现代 GPU,游戏中的实时路径追踪变得可行,但将其集成到 RE ENGINE 等专有引擎中需要大量的工程努力。

参考链接

标签: #path tracing, #real-time rendering, #game development, #NVIDIA, #graphics


运河底部遗忘计算机引发架构辩论 ⭐️ 7.0/10

一篇关于在运河底部发现被遗忘计算机设计的文章,重新引发了关于能力架构和专用硬件可能复兴的讨论。 这一历史遗迹挑战了通用计算的主导地位,并暗示随着摩尔定律放缓,定制硬件可能再次变得经济可行,从而影响未来处理器设计。 该计算机似乎是一台使用标记架构的能力机器,这一概念在 1970-80 年代处于前沿,但被商品化 CPU 所取代。文章指出,商品化曲线可能正在结束,使专用硬件再次具有吸引力。

hackernews · Kudos · 7月18日 08:33 · 社区讨论

背景: 能力架构是一种通过能力(而非传统页表)来管理内存保护和访问权限的硬件设计。在 1970-80 年代得到大量研究,但随着 x86 等商品化处理器提供更好的性价比而逐渐衰落。随着登纳德缩放定律的终结和摩尔定律放缓,专用硬件(如 GPU、TPU)变得更为常见,重新引发了人们对这种替代设计的兴趣。

参考链接

社区讨论: 评论者指出,能力机器曾是最前沿的,但被商品化曲线和摩尔定律所碾压。一些人赞赏文章中的音响发烧友引用,另一些人则对现存的文档和专用硬件的可行性表示好奇。

标签: #computer architecture, #history, #hardware, #capability machines, #specialized hardware


Zilog Z80 庆祝其 50 年影响力 ⭐️ 7.0/10

Z80 CPU 迎来了 50 周年纪念,引发了社区对其架构和遗产的怀旧反思与技术讨论。 Z80 驱动了许多早期个人电脑和嵌入式系统,塑造了微处理器行业。它的周年纪念突显了单片设计的持久影响。 Z80 与 Intel 8080 二进制兼容,但扩展了指令集并增加了寄存器。它被用于 ZX Spectrum 和 TRS-80 等系统,至今仍在生产用于嵌入式领域。

hackernews · st_goliath · 7月17日 19:41 · 社区讨论

背景: Z80 由 Zilog 于 1976 年推出,由曾领导 Intel 8080 开发的 Federico Faggin 设计。其低廉的价格和性能使其成为家庭计算机革命的核心,驱动了 ZX81、TRS-80 和 Game Boy 等设备。该 CPU 的架构还影响了后来的设计,至今仍在嵌入式控制器中使用。

社区讨论: 爱好者们分享了在 Z80 机器上学习汇编的个人故事,称赞其优雅性和文档。有人指出了 Z80 与 8080 之间的兼容性细微差别,尤其是标志寄存器的行为。其他人则回忆了 Z80 系统的经济实惠和丰富的软件生态。

标签: #hardware, #retrocomputing, #CPU, #Z80, #history


学习实用的 SQLite 工作流技巧 ⭐️ 7.0/10

Julia Evans 分享了改善 SQLite 工作流的实用技巧,包括使用 .expert 模式获得索引建议、避免 ORM 的 n+1 问题,以及通过专用工具简化 S3 凭据生成。 这些技巧帮助开发者优化 SQLite 性能并减少常见烦恼,使 SQLite 在中小规模数据处理和备份中更高效。 SQLite 命令行工具中的 .expert 模式可以在分析查询后自动推荐索引,解决常由 ORM n+1 问题导致的删除缓慢。s3-credentials 工具可为特定 S3 存储桶生成限定范围的读写凭据,避免手动控制台操作。

hackernews · surprisetalk · 7月17日 17:45 · 社区讨论

背景: SQLite 是一种轻量级的嵌入式数据库引擎,广泛应用于各类应用。.expert 命令分析 SQL 查询并建议索引以提升性能,而 n+1 查询问题是指 ORM 执行大量单独查询而非一次批量查询。s3-credentials 工具可自动创建限定于特定存储桶的 AWS 凭据。

社区讨论: 评论者强调了 .expert 模式的实用性以及删除缓慢背后的经典 n+1 问题。一位读者因对 AWS 控制台不满而构建了 s3-credentials 工具,另一位则欣赏这种真实的探索风格,与 AI 生成的文章形成对比。还有人分享了使用 .dump 配合 zstd 压缩的备份脚本。

标签: #SQLite, #database, #tooling, #performance


PostHog 平台通过 AI 可观测性实现自驱产品 ⭐️ 7.0/10

PostHog 发布了开源平台,将 AI 可观测性、产品分析、会话回放、功能标志等整合到一个工具中,用于构建自驱产品。它还提供了 Model Context Protocol (MCP)服务器,用于将 AI 代理连接到 PostHog 的数据。 该平台通过将分析、错误跟踪和 AI 上下文捕获整合到一个开源解决方案中,减少了对多个单独工具的需求。它使开发者能够构建自动检测和修复问题的产品,从而可能加速开发周期。 PostHog 的自驱模式可以将错误、愤怒点击等信号转化为调研报告和拉取请求。该平台还支持从 Stripe、Hubspot 等外部工具同步数据仓库。

rss · GitHub Trending - Daily · 7月18日 17:00

背景: PostHog 是一个开源产品分析平台,最初以会话回放和功能标志而闻名。新的“自驱”模式利用 AI 主动分析产品数据并建议或实施修复,使其成为现代开发团队的全面工具。

参考链接

标签: #open-source, #developer-tools, #analytics, #AI-observability, #product-engineering


Hallmark:为 AI 编程工具设计的反 AI 俗套技能 ⭐️ 7.0/10

Hallmark 是一个针对 Claude Code、Cursor 和 Codex 的新设计技能,它通过运行 57 个俗套测试门和一次预输出自我批评来强制生成非 AI 风格的设计。 它解决了 AI 生成界面同质化日益严重的问题,为开发者提供了一种生成独特、专业外观界面的方法,而不是大语言模型默认的通用模板。 Hallmark 从 20 个主题中选择宏观结构,运行 57 个俗套测试门加自我批评,如果检测到反模式则重新生成。它提供四个动词:默认构建、审计、重新设计和研究。

rss · GitHub Trending - Daily · 7月18日 17:00

背景: AI‘俗套’(AI slop)指的是大语言模型经常生成的通用、陈词滥调的设计,例如使用 Inter 字体、紫色渐变和对称卡片布局。Hallmark 是一个用于 Claude Code、Cursor、Codex 等 AI 编程助手的‘技能’,可以通过一条命令安装。它由 Together AI 的 Nutlope 创建,已在 GitHub 上获得超过 1.2 万星标。

参考链接

标签: #AI coding assistants, #design tool, #anti-slop, #Claude Code, #Cursor