Skip to the content.

从 137 条内容中筛选出 25 条重要资讯。


  1. OpenAI 宣布数学与理论计算机科学十项进展 ⭐️ 9.0/10
  2. 美团发布 LongCat-2.0:国产算力集群训练的万亿参数模型 ⭐️ 9.0/10
  3. Go 1.27 交互式导览:泛型、MTE 修复与 HTTP 排空 ⭐️ 8.0/10
  4. 字节跳动发布 Seedance 2.5 AI 视频模型,主打一次成片与灵活参考 ⭐️ 8.0/10
  5. GitHub 发布官方 Copilot SDK,支持六种主流语言 ⭐️ 8.0/10
  6. Hugging Face 发布用于本地语音助手的语音到语音库 ⭐️ 8.0/10
  7. 微软发布 TRELLIS.2:用于 3D 生成的紧凑结构化潜空间 ⭐️ 8.0/10
  8. 字节跳动开源 DeerFlow 2.0 SuperAgent 框架,支持长时任务 ⭐️ 8.0/10
  9. DeepSeek V4-Flash-0731:3040 亿参数开放权重模型性价比极高 ⭐️ 8.0/10
  10. 无状态 MCP 重燃兴趣,催生 mcp-explorer 与 datasette-mcp ⭐️ 8.0/10
  11. 黑客利用 ColdCard 固件随机数漏洞盗走 8670 万美元比特币 ⭐️ 8.0/10
  12. NVIDIA 软硬件协同设计注意力机制,加速长上下文推理 ⭐️ 8.0/10
  13. MineExplorer:让 AI 走出温室的长程评测基准 ⭐️ 8.0/10
  14. Bor:面向 Linux 桌面的开源策略管理 ⭐️ 7.0/10
  15. Diátaxis:让技术文档更清晰的四大分类框架 ⭐️ 7.0/10
  16. 微软推出面向初学者的免费 12 周 AI 课程 ⭐️ 7.0/10
  17. GitHub 精选清单:200 多项系统化交易学习资源 ⭐️ 7.0/10
  18. GitHub 发布官方 gh-stack CLI 扩展,用于管理堆叠式 PR ⭐️ 7.0/10
  19. 腾讯云开源 TencentDB Agent Memory:AI Agent 团队级记忆中枢 ⭐️ 7.0/10
  20. AI 公开信:业界敦促美国避免限制开放权重模型 ⭐️ 7.0/10
  21. Simon Willison 做客 Oxide and Friends 播客,热议开放权重革命 ⭐️ 7.0/10
  22. smevals:用于评估模型、提示词和测试框架的轻量级评测套件 ⭐️ 7.0/10
  23. 阿里开源 22B 模型,实现实时无漂移数字人 ⭐️ 7.0/10
  24. 因污染问题,xAI 将拆除 Colossus 数据中心 69 台移动涡轮机 ⭐️ 7.0/10
  25. Servo 0.4.0 发布:创纪录提交、布局改进与 WebGPU 支持 ⭐️ 7.0/10

OpenAI 宣布数学与理论计算机科学十项进展 ⭐️ 9.0/10

OpenAI 今日宣布,其下一代主要模型的内部版本 Astra 在数学与理论计算机科学领域取得了十项新成果,涵盖几何学、密码学与复杂性理论中的长期未解难题。该公司表示,按 GPT-5.6 Sol 的 token 价格计算,每个成果的花费不到 2000 美元。 这可能是数学领域的‘深蓝时刻’:一个通用人工智能模型在人类数十年未能攻克的难题上取得了实质性进展。若经证实,它可能重塑数学研究的方式,并在密码学与复杂性理论领域产生连锁反应。 OpenAI 发布了 Lean 4 形式化证明仓库(openai/ten-proofs)、描述这些解法的一篇论文,以及由 LLM 生成的、重建推理过程的 PDF。公告没有披露在未获解的问题上尝试了多少次,也没有公开底层使用的提示词。

rss · OpenAI News · 8月1日 00:00

背景: Lean 4 是一种交互式定理证明器,用于编写并机械地验证数学证明,从而使那些难以直接用人工判断的 AI 生成的论证可以被检验。OpenAI 此次发布之前,Anthropic 刚声称 Claude Mythos 发现了密码学弱点,这反映出大型语言模型越来越多地应用于形式化数学。陶哲轩(Terence Tao)将这一趋势形容为向‘大数学’(big mathematics)的转型:人类负责创造性部分,AI 承担大量技术性苦力工作。

参考链接

社区讨论: 相关讨论中,许多数学家正经历被一些观察者称为‘集体深蓝时刻’的感受,有人甚至在文章中将其描述为一场‘深刻的灵性危机’,例如 Kirwin Hampshire 的《数学的暗夜》。也有评论者赞赏其透明度,但指出仍缺少关键细节,尤其是实际使用的提示词以及失败的尝试次数。

标签: #mathematics, #theoretical computer science, #cryptography, #complexity, #open problems


美团发布 LongCat-2.0:国产算力集群训练的万亿参数模型 ⭐️ 9.0/10

美团于 2026 年 6 月 30 日正式发布 LongCat-2.0,这是一个总参数达 1.6 万亿的大语言模型。它是业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型。 这一里程碑表明,在高端 GPU 出口管制的背景下,中国完全可以在国产 AI 硬件上训练和部署万亿参数模型,推动 AI 自主可控。该模型面向 Agentic Coding(智能体编程)并原生支持 1M 上下文,也预示着 AI 驱动的软件开发将向规模化实用方向演进。 LongCat-2.0 总参数 1.6T,平均激活约 48B(动态范围 33B~56B),从零开始预训练。其架构创新性地引入 LongCat 稀疏注意力(LSA)与 N-gram 嵌入,提升长上下文处理效率和 Token 级表示能力,并结合动态激活机制增强代码理解、生成与执行能力。

rss · 美团 Blog · 8月2日 17:03

背景: 训练大语言模型传统上依赖大量高端 GPU(如 NVIDIA A100/H100)集群,而这些芯片受到严格的出口管制。LongCat-2.0 则是在超过 5 万颗国产 AI ASIC 集群上完成预训练,并通过系统性优化将训练吞吐量较朴素实现提升了 35%以上。Agentic Coding(智能体编程)指利用 AI 智能体自主完成代码生成、调试、测试等软件开发任务,而不仅仅局限于自动补全或单轮生成。

参考链接

标签: #AI, #large language model, #domestic compute, #agentic coding, #Meituan


Go 1.27 交互式导览:泛型、MTE 修复与 HTTP 排空 ⭐️ 8.0/10

VictoriaMetrics 发布了一个 Go 1.27 交互式导览,介绍新语言特性和标准库变化。该版本修复了 runtime.findnull() 以兼容 Android 的 Memory Tagging Extension(MTE),并改变行为:自动排空(drain)HTTP 响应体。 Go 1.27 是使用最广泛的编程语言之一的重要版本,其特性变化会影响庞大的开发者生态。MTE 兼容性修复移除了在基于 gomobile 的应用中启用硬件内存标签的障碍,而 HTTP 排空改动可改善资源清理,但也可能静默改变现有行为。 该导览使用 Box[T] 泛型类型及其 MapU any Box[U] 方法等交互式示例。评论者指出,自动排空 HTTP 响应体是一个微妙的静默行为变化;Android MTE 修复涉及 runtime.findnull(),对应两个 Go CL(749062 和 751020)。

hackernews · Hixon10 · 8月2日 01:35 · 社区讨论

背景: Go 是一种静态类型编译型语言,大约每半年发布一个大版本,VictoriaMetrics 以交互式导览形式介绍 Go 1.27。MTE 是 Armv8.5 引入的硬件特性,通过给内存分配打标签来检测内存安全错误;Android 支持在原生应用中使用 MTE,而 Go 的 runtime.findnull() 中的 bug 曾阻止 gomobile 应用在支持 MTE 的 Android 系统(如 GrapheneOS)上启用 MTE。排空 HTTP 响应体指读取并丢弃剩余数据,以便连接可以复用;如果自动执行,依赖旧的非排空行为的应用可能会观察到细微差异。

参考链接

社区讨论: 社区评论意见不一:一些有 10 年以上 Go 经验的开发者觉得泛型 Map 示例难以理解,认为它带来了“认知负担”;另一些人则认为该版本是改进,尤其认可自动 HTTP 排空(但提醒这是静默行为变化)和 MTE 修复。也有评论称赞 Go 标准库,尤其是 crypto 包。

标签: #Go, #programming languages, #release, #generics, #standard library


字节跳动发布 Seedance 2.5 AI 视频模型,主打一次成片与灵活参考 ⭐️ 8.0/10

字节跳动推出了其 AI 视频生成模型的最新版本 Seedance 2.5,主打“一次成片”创作与灵活的参考功能。此前有报道称该模型上个月在北京的一场会议上亮相,最快可能于本周正式发布。 此次发布加剧了快速发展的 AI 视频生成市场的竞争,各大厂商正在质量、控制和成本上展开争夺。对于创作者和电影制作人来说,Seedance 2.5 的一次成片和参考功能有望显著简化视频制作流程。 该模型强调“一次成片”生成,力求一次生成最终质量的视频,而不是反复迭代。一些社区分析指出,它主要面向动作和高特效镜头的文生视频,发布页面中仅展示了一个人物参考镜头。

hackernews · njaremko · 8月1日 20:45 · 社区讨论

背景: Seedance 是字节跳动的 AI 视频生成模型系列。早期的 Seedance 1.0 支持从文本和图像进行多镜头视频生成,可生成 1080p 视频,画面流畅、细节丰富。Seedance 2.0 曾因版权问题遭到美国电影协会批评,迪士尼还向字节跳动发出过停止侵权函。所谓“一次成片”指模型一次性生成完整视频,而“灵活参考”允许用户提供参考图或视频以保持角色或场景一致。

参考链接

社区讨论: 评论者普遍认可其生成质量,但认为字节跳动的技术路线似乎更贴合中国市场对动作和特效镜头的需求,而欧美电影制作人常常需要视频到视频的工作流和对话驱动场景。有人担忧使用最新模型的推理成本较高,也有人指出 24 小时内即将发布开源权重的 MiniMax H3 能在控制力和成本上更具优势。少数人则认为 AI 视频生成工具弊大于利。

标签: #AI video generation, #ByteDance, #generative media, #text-to-video, #model release


GitHub 发布官方 Copilot SDK,支持六种主流语言 ⭐️ 8.0/10

GitHub 发布了 GitHub Copilot SDK,这是一个多平台 SDK,用于将 Copilot Agent 功能嵌入到应用程序和服务中。该 SDK 支持 Node.js/TypeScript、Python、Go、.NET、Java 和 Rust,并且暴露了与 Copilot CLI 相同的生产级 agent 运行时。 此次发布大大降低了构建 Copilot 集成的门槛,让开发者无需从头构建编排逻辑即可将 agentic 工作流嵌入自己的工具中。它对 AI 工具开发者以及更广泛的 AI 驱动开发者工具生态具有重要影响。 该 SDK 负责处理规划、工具调用和文件编辑,开发者只需定义 agent 行为。相关包已发布到 npm、PyPI、NuGet、Go module proxy、crates.io 和 Maven Central,并且大多数语言提供了 cookbook 和 API 文档。

rss · GitHub Trending - Daily · 8月2日 17:02

背景: GitHub Copilot 是 GitHub 的 AI 结对编程助手,可运行在 IDE、CLI 和其他界面中;Copilot agents 能够研究代码仓库、规划变更并创建拉取请求。Copilot CLI 是 Copilot 的命令行界面,而新 SDK 暴露了 CLI 背后相同的 agent 运行时,开发者可以以编程方式调用它。这使得企业可以构建自定义 agent,或将 Copilot 集成到聊天应用、项目工具和 MCP 服务器中。

参考链接

标签: #GitHub Copilot, #SDK, #AI, #Developer Tools, #Open Source


Hugging Face 发布用于本地语音助手的语音到语音库 ⭐️ 8.0/10

Hugging Face 发布了 speech-to-speech,这是一个低延迟、完全模块化的语音智能体流水线(VAD -> STT -> LLM -> TTS),通过 OpenAI Realtime 兼容的 WebSocket API 暴露。它可以使用 Parakeet TDT 进行语音识别、OpenAI 兼容的 LLM 和 Qwen3-TTS 进行语音输出,完全在本地硬件上运行。 该库降低了开发者使用完全本地、开源组件构建语音智能体的门槛,为托管式语音 AI 服务提供了保护隐私且经济高效的替代方案。它与 OpenAI Realtime API 的兼容性便于在云托管和自托管后端之间切换,可能加速开源语音 AI 的普及。 该流水线已在生产环境中作为数千台 Reachy Mini 机器人的对话后端运行。LLM 插槽支持任何 OpenAI 兼容协议,因此用户可以将其指向托管提供商、Hugging Face Inference Providers,或本地的 vLLM/llama.cpp 服务器,以实现完全本地化的开源技术栈。

rss · GitHub Trending - Daily · 8月2日 17:02

背景: 语音智能体通常将语音识别(STT)、用于推理的语言模型和文本转语音(TTS)串联起来,并使用语音活动检测(VAD)来管理轮流说话和打断。语音 AI 平台通常以云 API 形式提供这些能力,但在本地运行开源组件可以降低延迟、成本并让数据留在设备上。该库将此流水线封装在 OpenAI Realtime 兼容的 WebSocket API 之后,使得将托管端点替换为自托管端点变得直接简单。

参考链接

标签: #voice AI, #speech-to-speech, #open-source, #Hugging Face, #agents


微软发布 TRELLIS.2:用于 3D 生成的紧凑结构化潜空间 ⭐️ 8.0/10

微软发布了 TRELLIS.2,一个 40 亿参数的图像到 3D 生成模型,并同步推出了 arXiv 论文和 Hugging Face 在线演示。它引入了一种名为 O-Voxel 的新型“无场”稀疏体素结构,为高效高保真 3D 生成提供了原生且紧凑的结构化潜空间。 这是 3D 生成领域的一大进步,能够快速创建具有复杂拓扑结构和完整 PBR 材质的高分辨率资产,有望简化游戏开发、视觉特效和扩展现实内容制作流程。这种结构化潜空间方法可能会影响未来的研究,并让高质量 3D 资产创作惠及更广泛的用户。 该模型使用具有 16 倍空间下采样的稀疏 3D VAE 将资产编码为紧凑的潜空间,并能跑在标准 DiT 架构上。在 NVIDIA H100 上,它生成 512³分辨率资产约需 3 秒、1024³约 17 秒、1536³约 60 秒,且数据处理完全无需渲染和优化。

rss · GitHub Trending - Daily · 8月2日 17:02

背景: 传统 3D 生成常依赖等值面场(如 NeRF 或基于 SDF 的方法),这类方法难以处理开放表面、非流形几何和内部封闭结构,并且通常需要多阶段流水线。TRELLIS.2 的 O-Voxel 表示通过直接处理任意拓扑结构,同时建模基础色、粗糙度、金属度和不透明度等表面属性,避免了有损转换,从而支持照片级真实感渲染。

参考链接

标签: #3D generation, #computer vision, #generative models, #AI research, #Microsoft


字节跳动开源 DeerFlow 2.0 SuperAgent 框架,支持长时任务 ⭐️ 8.0/10

2026 年 2 月 28 日,字节跳动发布 DeerFlow 2.0,这是其开源 SuperAgent 框架的彻底重写版本,发布后登上 GitHub Trending 榜首。该项目采用 MIT 许可证,通过编排子代理(sub-agents)、记忆、沙箱和工具,可处理耗时为数分钟到数小时的任务。 DeerFlow 2.0 表明大型科技公司正押注开源自研的生产级智能体编排方案,这将降低研究者和工程师构建长时 AI 智能体的门槛。它也反映出行业趋势正从单轮对话聊天机器人,转向需要在较长时间内规划、执行并自我纠错的智能体系统。 DeerFlow 2.0 与 v1 没有共享任何代码,v1 仍在 1.x 分支维护;新版本基于 LangGraph 和 LangChain 构建,要求 Python 3.12+ 和 Node.js 22+。字节跳动建议配合 Doubao-Seed-2.0-Code、DeepSeek v3.2 或 Kimi 2.5 使用,并提供了配套桌面工具 LLM Space,用于原型验证、分步调试和性能基准测试。

rss · GitHub Trending - Daily · 8月2日 17:02

背景: 长时任务(long-horizon tasks)是指需要 AI 智能体执行数十步乃至数百步顺序决策和操作才能完成的目标。DeerFlow(Deep Exploration and Efficient Research Flow,深度探索与高效研究流程)是一个“超级智能体框架”,通过编排子代理、持久记忆和沙箱来处理研究、编程和内容创作等任务。v1 原本是一个深度研究框架,而 v2 是面向通用长时自动化的大规模重写,二者没有任何共享代码。

参考链接

标签: #ai-agents, #open-source, #agent-framework, #long-horizon-tasks, #bytedance


DeepSeek V4-Flash-0731:3040 亿参数开放权重模型性价比极高 ⭐️ 8.0/10

DeepSeek 发布了 DeepSeek-V4-Flash-0731,一个 3040 亿参数的开放权重模型,具备显著增强的 agentic(智能体)能力。其定价为每百万输入 token 0.14 美元、每百万输出 token 0.27 美元,在 Artificial Analysis Intelligence Index 上的排名超过了 4280 亿参数的 MiniMax M3。 该模型目前可能是市场上性价比(单位智能成本)最高的选择,让前沿能力的获取成本大大降低。它也反映出中国开放权重实验室正在以极具攻击性的姿态与专有前沿模型竞争。 这个 3040 亿参数的模型在 Hugging Face 上体积为 167GB,输出质量高度依赖推理工作量(reasoning effort):Simon Willison 用 pelican 测试时,默认推理级别生成的自行车图像非常糟糕,而调高推理级别后效果明显改善。OpenRouter 上可以通过 openrouter/deepseek/deepseek-v4-flash-0731 调用,并支持 reasoning_effort 参数。

rss · Simon Willison · 7月31日 23:59

背景: 开放权重(open-weight)模型会发布训练好的权重,开发者可以自行部署和微调,从而降低相比按 token 计费 API 的成本。Agentic(智能体)能力指的是大语言模型进行推理、行动和交互的能力,这正是 AI 智能体能够规划并执行任务的基础。DeepSeek 是一家以推动高效开放权重模型前沿而闻名的中国 AI 实验室。Artificial Analysis Intelligence Index 是对多个生产级基准分数进行加权平均(0 到 100 分)的指标,用于比较模型的智能水平。

参考链接

标签: #AI, #DeepSeek, #LLM, #open-source, #model release


无状态 MCP 重燃兴趣,催生 mcp-explorer 与 datasette-mcp ⭐️ 8.0/10

Simon Willison 表示,新的无状态 MCP 规范(MCP 2.0,2026 年 7 月 28 日发布)重新点燃了他对 Model Context Protocol 的兴趣。他还介绍了基于该更新协议构建的两个新工具:mcp-explorer 和 datasette-mcp。 这是 MCP 自发布以来最重要的变化之一,通过消除会话状态大幅简化了客户端和服务端的实现。此事意义重大,因为更易于审计和控制使 MCP 工具相比给智能体开放带互联网的 shell 环境,成为更安全、更实用的选择。 旧版 MCP 需要两次 HTTP 请求并维护服务端的 Mcp-Session-Id,而新的无状态版本只需单次请求,并使用 MCP-Protocol-Version 和 Mcp-Method 等头部字段。2026-07-28 规范还加入了扩展框架、Tasks 和强化授权;mcp-explorer 是借助 Codex 构建的交互式探测工具。

rss · Simon Willison · 7月31日 23:13

背景: MCP 是 Anthropic 于 2024 年 11 月推出的开放标准,旨在规范 AI 系统连接外部工具的方式,并被多家主要 AI 提供商广泛采用。2025 年底,Anthropic 的 Skills 功能部分地掩盖了 MCP 的光芒,因为具备终端和 curl 的强智能体可以更灵活地完成许多任务。无状态协议顾名思义,不会在请求之间保留会话状态,这提高了可扩展性和可靠性,但可能会增加每次请求中的重复数据。

参考链接

标签: #MCP, #Model Context Protocol, #AI agents, #developer tools, #protocol specification


黑客利用 ColdCard 固件随机数漏洞盗走 8670 万美元比特币 ⭐️ 8.0/10

自 7 月 30 日起,黑客分三轮从 4585 个地址盗走 1367 枚比特币(价值约 8670 万美元),利用的是 ColdCard 2021 年固件中的随机数生成器缺陷。第三轮攻击通过将资金分散到 293 个 P2WSH 地址来隐藏转账路径。 这是由加密缺陷导致的最大规模硬件钱包被盗事件之一,说明即使经过审计的固件也可能悄悄回退到弱随机数。所有使用受影响固件生成助记词的 ColdCard 用户都会受影响,这也提醒人们仅更新固件并不够,必须重新生成密钥并迁移资产。 根因是 Coinkite 在 2021 年 3 月 17 日发布的固件将 MICROPY_HW_ENABLE_RNG 设为 0,而 libngu 加密库只检查该宏是否存在、不检查其值,导致系统回退到以芯片 UID 和计时器寄存器为种子的 MicroPython Yasmarang 软件随机数生成器。ColdCard Mk3 助记词随机性仅约 40 位,而 Mk4、Q 和 Mk5 的候选空间也只剩约 40 亿种组合,用 GPU 集群即可暴力破解。

rss · IT HOME · 8月2日 07:42

背景: 硬件钱包是用于离线保存比特币私钥的空气隔离设备,初始化时依靠密码学随机数生成助记词种子。如果随机数强度不足,攻击者无需接触设备,即可离线重新生成种子、推导地址并与公开的比特币 UTXO 数据比对。第三轮攻击使用了 P2WSH 地址,这类地址在资金首次被支出之前不会公开脚本,因此比普通的 P2WPKH 地址更难追踪。

参考链接

标签: #security, #cryptocurrency, #hardware wallet, #RNG, #exploit


NVIDIA 软硬件协同设计注意力机制,加速长上下文推理 ⭐️ 8.0/10

NVIDIA 发布了一篇技术博客,介绍了一种针对 AI 模型注意力机制的软硬件协同设计方法,旨在实现快速、交互式的长上下文推理。该方法着眼于减少随着上下文长度增加而不断上升的注意力计算在推理时间中的占比,尤其针对智能体(agentic)工作负载。 智能体和长上下文工作负载日益普及,注意力机制正成为大语言模型推理中日益关键的瓶颈。将注意力机制与硬件和软件协同设计,可显著降低交互式 AI 应用的延迟与成本,使研究人员和工程师均受益。 该博客指出,随着上下文长度增加,注意力计算在总推理时间中所占比例越来越大。文章中可能涉及的具体技术包括稀疏注意力、KV 缓存优化以及专用计算内核,但现有内容只展示了部分实现细节。

rss · NVIDIA Developer Blog · 7月31日 22:16

背景: 基于 Transformer 的大语言模型依赖注意力机制来关联不同 token,但长输入会使注意力计算量和 KV 缓存内存显著增长。LLM 推理通常分为预填充(prefill)和解码(decode)两个阶段;通过软硬件协同设计来优化注意力是一个活跃的研究领域,例如 SALO2 和基于 FPGA 的加速器。NVIDIA 还提供更广泛的 LLM 推理优化指导,涵盖量化、批处理和投机解码等技术。

参考链接

标签: #AI inference, #long-context, #attention mechanisms, #LLM optimization, #NVIDIA


MineExplorer:让 AI 走出温室的长程评测基准 ⭐️ 8.0/10

美团 LongCat 团队发布了 MineExplorer,这是首个在开放世界中评测多模态大模型分钟级长程任务的基准。它系统性地测试模型在需要长程规划且包含隐藏前置条件的任务上的表现,揭示了被忽视的能力断层。 现有的大多数多模态大模型基准都集中在短周期、条件明确的任务上,而实际应用需要持续的规划和适应隐藏条件的能力。MineExplorer 提供了一个更贴近现实的评测工具,有望引导多模态智能体的研发,并影响学术界评估模型局限性的方式。 MineExplorer 基于 Minecraft 这一常用于具身智能体研究的开放世界环境,其复现代码已在 GitHub 的 meituan-longcat 组织下开源。该基准特别关注隐藏前置条件,即任务指令中未明确说明、但完成目标所必需的条件,这是现有基准往往忽略的方面。

rss · 美团 Blog · 8月2日 17:03

背景: 多模态大语言模型在 LLM 的基础上扩展了视觉和推理能力,使其能够完成涉及文本和图像的任务。对这些模型的评测通常使用指令明确、交互较短的基准,这可能无法反映开放世界中长程规划的复杂性,智能体需要随时间进行推理、记忆和调整。美团 LongCat 是推出 LongCat-2.0 模型的 AI 团队,该模型是一个支持原生长上下文的大规模 MoE 模型。MineExplorer 在此基础上进一步提供了对 MLLM 智能体更具挑战性和更贴近现实的评测。

参考链接

标签: #multimodal-LLM, #benchmark, #long-horizon-planning, #open-world-agents, #evaluation


Bor:面向 Linux 桌面的开源策略管理 ⭐️ 7.0/10

Bor v0.8 是一个面向 Linux 桌面的开源集中式策略管理系统,使用轻量级 Go 代理和中央服务器通过 mTLS/gRPC 实时向客户端推送策略。它新增了对 Thunderbird、Microsoft Edge for Business 和 FirewallD 区域的支持。 这填补了 Linux 桌面集中管理领域的空白,目前该领域缺乏优秀的开源解决方案。它可以帮助管理大量 Linux 工作站的组织(如非营利组织和公司)减少手动配置工作,并强制执行一致的策略。 该系统支持 Firefox、Chrome、KDE、dconf、polkit 和包管理策略,v0.8 新增了策略类型。它使用 mTLS 进行身份验证,通过 gRPC 实时流式传输,摒弃了轮询机制,但作者尚未详细说明在客户端离线时如何处理配置漂移和策略强制执行。

hackernews · eniac111 · 8月2日 09:06 · 社区讨论

背景: dconf 是一个底层配置系统,用作 GNOME 中 GSettings 的后端,用于管理桌面设置。Polkit 是一个授权框架,允许非特权进程与特权进程通信。FirewallD 提供动态管理的防火墙区域,定义网络连接的信任级别。这些是 Linux 桌面环境中的常见组件,Bor 可以集中管理它们。

参考链接

社区讨论: 评论者对项目表示热情,有人提到这非常接近他们管理非营利组织笔记本电脑所需的功能。问题集中在自定义脚本执行、用户映射、与 System76 的 COSMIC Sync 等工具的比较、为何选择 mTLS 而不是 SSH,以及无轮询情况下如何防止配置漂移。

标签: #linux, #desktop-management, #open-source, #devops, #policy-management


Diátaxis:让技术文档更清晰的四大分类框架 ⭐️ 7.0/10

Diátaxis 这一将技术文档分为教程、操作指南、参考和解释四类来组织的框架,在 Hacker News 的讨论中得到关注。框架作者还宣布正在将 Diátaxis 翻译成多种语言。 Diátaxis 已成为改善开发者体验和信息架构的广泛采用的方法。围绕这四种类型重组文档,可以让内容更容易被发现和维护,这在文档经常成为痛点的开发者生态系统中尤为重要。 该框架根据用户需求和写作语态区分内容:教程面向学习,操作指南解决具体问题,参考是描述性的,解释则提供背景脉络。官方网站也提醒,真实文档可能涉及复杂的层次结构,需要谨慎应用该模型。

hackernews · ryanseys · 8月1日 20:33 · 社区讨论

背景: Diátaxis 源于古希腊语,意为“跨排列”,是由 Daniele Procida 创建的一个系统性框架。它根据用户需求将技术文档分为四种类型,已被 Canonical、Qiskit 等组织采用。该框架旨在解决文档内容、风格和架构方面的问题。

参考链接

社区讨论: 评论者普遍分享了积极的实际经验。rkangel 表示它在代码库交接工作中“非常棒”,jamilbk 则认为它很有帮助但提醒不要奉为圭臬,并建议在开始前通读整个网站。作者 DanieleProcida 借此机会宣传了进行中的多语言翻译工作,也有用户调侃说读了之后会发现所有文档都有缺陷,还有人指出这是一篇被多次提交的旧文。

标签: #documentation, #technical writing, #developer experience, #information architecture, #knowledge management


微软推出面向初学者的免费 12 周 AI 课程 ⭐️ 7.0/10

微软发布了 AI-For-Beginners 开源课程,提供为期 12 周、共 24 节课的人工智能结构化入门。课程包含实践课程、测验、实验,并涵盖 TensorFlow 和 PyTorch 等工具及 AI 伦理。 这一免费的多语言资源使更广泛的受众(包括学生、开发者和教育工作者)都能接触到 AI 教育。它有助于满足在日益由 AI 驱动的行业中,人们对 AI 素养和实践技能不断增长的需求。 该课程对初学者友好,并通过 GitHub Actions 自动翻译成多种语言。它还包括手绘笔记(sketchnotes)、Discord 社区以及用于交互式笔记本的 Binder 集成。

rss · GitHub Trending - Daily · 8月2日 17:02

背景: AI-For-Beginners 是微软提供新兴技术免费教育资源这一更广泛努力的一部分,与其在机器学习、数据科学和 Web 开发方面的其他’For-Beginners’课程类似。该课程设计为自学式,每节课包含手绘笔记、课前测验、书面课程和实践练习。这种方法降低了入门门槛,使不需要深厚计算机科学背景的人也能理解 AI 概念。

标签: #AI education, #curriculum, #Microsoft, #beginners, #open source


GitHub 精选清单:200 多项系统化交易学习资源 ⭐️ 7.0/10

paperswithbacktest/awesome-systematic-trading 仓库精选了 97 个库、40 余种策略、55 本书籍、23 个视频,以及博客和课程,用于研究和运行系统化交易策略。它还提供了中文版 README。 作为一个组织良好的单一参考资源,它降低了进入量化金融的门槛,为初学者和专业人士提供了社区验证的路线图。这之所以重要,是因为系统化交易正成为主流方法,它依赖算法规则而非人工判断。 该清单分为事件驱动和向量化回测框架、加密货币工具、交易机器人、分析、指标和优化等类别。其关联网站 paperswithbacktest.com 提供额外用 Python 实现的交易策略。

rss · GitHub Trending - Daily · 8月2日 17:02

背景: 系统化交易(又称机械式交易)是一种投资和交易决策遵循预定目标、风险控制和执行规则的方法。回测是将策略应用于历史市场数据,以评估其可能的表现。Awesome 清单是 GitHub 上流行的社区精选高质量资源集合。

参考链接

标签: #systematic trading, #quantitative finance, #resources, #open source, #trading libraries


GitHub 发布官方 gh-stack CLI 扩展,用于管理堆叠式 PR ⭐️ 7.0/10

GitHub 发布了一款官方 CLI 扩展 gh-stack,可自动创建和管理堆叠式 pull request。它还包含一个可选的 AI 智能体技能,可通过 gh skill install github/gh-stack 安装。 堆叠式 pull request 是一种日益流行的工作流,可将大型变更拆分为更小、更易审查的块,而官方工具降低了采用这一模式的门槛。AI 智能体集成也表明 GitHub 正在推动 AI 编程智能体更有效地应用于真实的 git 工作流。 堆栈元数据以 JSON 文件形式存储在本地 .git/gh-stack 中,该扩展会自动启用 git rerere,从而在多次 rebase 之间记住冲突解决方案。该工具需要 GitHub CLI v2.0+,并提供 initaddpushviewsubmit 以及 updowntopbottom 等导航命令。

rss · GitHub Trending - Daily · 8月2日 17:02

背景: 堆叠式 pull request 是一系列有序的、相互依赖的 PR,每个 PR 都构建在前一个 PR 之上,因此每一层都可以独立审查和合并。GitHub 最近宣布堆叠式 pull request 进入公开预览,而 gh-stack 正是实现该工作流的官方 CLI 扩展。该工具为每个分支创建一个 PR,并将每个 PR 的基础分支设置为它下方的分支,从而使审查者只看到该层的差异。

参考链接

标签: #GitHub CLI, #Stacked PRs, #Developer Tools, #Open Source, #AI Agents


腾讯云开源 TencentDB Agent Memory:AI Agent 团队级记忆中枢 ⭐️ 7.0/10

腾讯云开源了 TencentDB Agent Memory,这是一个团队级记忆中枢,将对话、文档和代码转化为四种可复用的记忆资产:Chat Memory、Skill、LLM-Wiki 和 Code-Graph。该项目目前处于 Team Memory Beta 阶段,可通过一条部署脚本快速启动。 它解决了 AI Agent 开发中的关键挑战:跨会话、跨框架的团队级持久记忆。通过共享记忆资产,团队可以减少重复劳动、降低 token 消耗,并让后续任务继承之前的结果和工作流。 该系统采用符号短期记忆与分层长期记忆相结合的方式,将繁重的工具日志压缩成紧凑的 Mermaid 符号,以降低 token 占用并提升任务成功率。部署时需要配置两组 LLM 参数(memory group 与 proxy group),依赖 Node.js >=22 和 OpenClaw,项目以 MIT 协议开源。

rss · GitHub Trending - Daily · 8月2日 17:02

背景: 基于大语言模型的 Agent 在长任务或跨会话场景中容易丢失上下文,导致效率和一致性下降。记忆中枢通过存储和检索有价值的信息,帮助 Agent 在多次交互中积累经验。TencentDB Agent Memory 并不试图“存储一切”,而是解决三个问题:什么值得保留、谁可以使用,以及如何用更少的检索获得更准确的结果。

参考链接

标签: #AI agents, #memory management, #open source, #LLM, #TencentCloud


AI 公开信:业界敦促美国避免限制开放权重模型 ⭐️ 7.0/10

西蒙·威利森(Simon Willison)总结了一波公开信,其中最引人注目的是由微软主导、日期为 2026 年 7 月 24 日、已有 235 家 AI 相关公司(包括 NVIDIA、亚马逊、Y Combinator、Linux 基金会以及后来的 OpenAI)签署的《开放权重与美国 AI 领导力》(Open Weights and American AI Leadership)。Anthropic 和《Pacing the Frontier》的另一批公开信也阐述了各自在开放权重模型和 AI 节奏控制上的立场。 这些公开信标志着 AI 行业协同反对美国政府可能对开放权重 AI 模型实施的限制,这场博弈可能影响未来数月的 AI 监管走向。该结果对依赖开放权重模型进行创新的开发者和研究者,以及所有关心先进 AI 安全性与开放性的人来说都至关重要。 值得注意的是,Anthropic 没有签署微软的公开信,而是在三天后发布了自身立场,呼吁打击“工业规模的蒸馏(distillation)作业”,同时表示“从未主张禁止开放权重模型”。标题为《Pacing the Frontier》的公开信则获得 Dario Amodei、Jakub Pachocki、Ilya Sutskever 等前沿 AI 公司 1,324 名员工的联署,信中请求美国政府支持国际社会努力,以审慎地调控自动化 AI 研发的节奏。

rss · Simon Willison · 8月2日 04:16

背景: 开放权重 AI 模型是指模型的参数——即决定其如何处理和生成文本的数学权重——对外公开的 AI 系统,而封闭模型通常只能通过 API 访问。这种透明性让研究者和开发者能够检查模型行为、发现漏洞并在此基础上继续开发;不过开放权重并不等同于完整的开源 AI,因为训练数据和部分代码仍可能是专有的。围绕开放权重的争论正是 AI 治理讨论的核心,需要在创新与透明、以及滥用风险和竞争优势流失之间做出权衡。

参考链接

标签: #AI policy, #open source, #open weights, #AI regulation, #industry


Simon Willison 做客 Oxide and Friends 播客,热议开放权重革命 ⭐️ 7.0/10

Simon Willison 做客 Oxide and Friends 播客,与 Bryan Cantrill 和 Adam Leventhal 一起探讨了“开放权重革命”,内容包括 Kimi K3 的前沿性能、意外网络安全事件以及关于开放权重的行业公开信。节目还回顾了一月份的预测,并新增了一条:教皇将在年底前就开放模型发表言论。 这场讨论捕捉到了一个关键节点:开放权重模型正与专有前沿模型并驾齐驱,重塑 AI 行业的竞争格局。播客提供了关于政策转向和安全事件的专家解读,这些都将影响 AI 的开发与部署方式。 在节目中,Willison 指出 Kimi K3 的发布证明开放权重模型可以媲美专有模型,并提到几乎所有 AI 大公司都签署了开放权重行业公开信,但 Anthropic 是明显的例外。他还提到,如果节目晚录几天,DeepSeek V4 Flash 0731 和 Anthropic 自身的网络安全事件肯定会被纳入讨论。

rss · Simon Willison · 7月31日 21:33

背景: 开放权重模型是指公开发布训练后权重的 AI 模型,任何人都可以下载、微调和自行托管,而专有模型只能通过 API 访问。Kimi K3 由 Moonshot AI 于 2026 年 7 月 16 日发布,是一个 2.8 万亿参数的混合专家(MoE)模型,每 token 激活 1040 亿参数,支持 100 万 token 上下文,是首个达到 3 万亿参数类别的开放模型。DeepSeek V4 Flash 是 DeepSeek 推出的效率优化 MoE 模型,总参数 2840 亿、激活参数 130 亿,同样支持 100 万 token 上下文。这些发布加剧了开放与专有 AI 之争,并影响行业政策走向。

参考链接

标签: #open-weights, #AI-models, #podcast, #industry-policy, #LLM


smevals:用于评估模型、提示词和测试框架的轻量级评测套件 ⭐️ 7.0/10

Simon Willison 与 Prime Radiant 发布了开源评测套件 smevals,开发者可以将评测(eval)定义为 YAML 文件,并针对多种模型配置运行。它提供了 uvx smevals docsrungradeservebuild 等命令来简化评测流程。 随着 LLM 应用日益广泛,轻量级且对代理友好的评测工具在比较模型和提示词方面变得越来越重要。smevals 降低了自定义评测的构建门槛,并且可以由编码代理完全驱动,这对 AI 从业者来说新颖且实用。 一个 eval 是包含 YAML 文件的目录,其中包含任务(tasks)、配置(configs,包括模型和其他参数)、评分器(graders)和检查(checks);评分器可以是简单的字符串检查,也可以是自定义的检查脚本,包括使用 LLM 作为评审者。该工具将运行(run)与评分(grade)分离,并能生成便于分享的静态 HTML 报告。

rss · Simon Willison · 7月31日 21:15

背景: smevals 是一个小型评测套件,用于回答有关模型能力的问题,例如模型生成 SVG 或创作俳句的能力如何。该项目是 Simon Willison 对评测方法的第三次迭代,由 Jesse Vincent 领导的应用 AI 研究实验室 Prime Radiant 共同构建。uvx 是 uv tool run 的别名,它能在临时环境中运行基于 Python 的命令行工具,类似于 pipx。该工具遵循了 EleutherAI 的 lm-evaluation-harness 等现有 LLM 评测框架的模式,但目标更简单、更适合代理使用。

参考链接

标签: #evaluation, #LLM, #developer-tools, #open-source, #AI


阿里开源 22B 模型,实现实时无漂移数字人 ⭐️ 7.0/10

阿里巴巴开源了一款 22B 参数模型,可实现实时、分钟级稳定的数字人生成。该模型还支持自定义角色的流式交互,让长视频生成不再出现身份漂移。 这意义重大,因为漂移问题长期以来限制了 AI 生成长视频的实际应用。通过提供自定义数字人的实时流式交互,该模型有望加速在直播、虚拟助理、教育和娱乐等领域的落地。 此次公告并未透露太多技术细节,例如具体模型系列或训练方法。该模型已开源,其“分钟级稳定”的说法表明它能在数分钟长的生成片段中保持身份的一致性。

rss · 量子位 · 8月2日 02:00

背景: 数字人生成利用 AI 创建逼真的虚拟角色,使其能够说话和交互,通常通过合成面部表情、唇形同步和手势来实现。视频 AI 中的“漂移问题”源于自回归模型逐帧预测,导致小误差随时间累积,使长视频中角色的身份或外观逐渐劣化。流式交互则是指根据用户输入实时生成视频回应,而不是使用预录片段。

参考链接

标签: #AI, #digital human, #real-time generation, #open-source, #video generation


因污染问题,xAI 将拆除 Colossus 数据中心 69 台移动涡轮机 ⭐️ 7.0/10

xAI 宣布将从今年 8 月起逐步拆除位于孟菲斯 Colossus 数据中心的全部 69 台移动涡轮发电机,并在 2027 年 7 月前彻底清退。与此同时,该公司正在建设一座装机容量 1.2GW、包含 41 台永久涡轮机的新发电厂,该电厂已于 2026 年 3 月获得《清洁空气法》许可。 这标志着人工智能数据中心自备燃气轮机供电这一日益流行的做法,首次遭遇重大监管逆转。由于 OpenAI 等公司正在效仿 xAI 的做法,这一和解协议可能影响整个行业在 AI 基础设施建设热潮中如何处理许可、排放控制和社区关系。 69 台这一数字修正了此前媒体报道的 59 台。这些移动机组在缺乏所需许可证的情况下运行,美国环保署明确表示它们不能豁免;全国有色人种协进会提起诉讼,司法部随后介入,称拆除可能危及国家安全,因为 Colossus 2 支持关键任务。xAI 表示将为其剩余的移动发电机配备先进的排放控制技术。

rss · IT HOME · 8月2日 12:45

背景: Colossus 是 xAI 位于田纳西州孟菲斯的超级计算机,于 2024 年 7 月投入使用,用于训练 Grok 聊天机器人。马斯克曾用 19 天完成 10 万块英伟达 H200 GPU 的安装,创下纪录,其做法是使用自有临时涡轮机供电,而非等待公共电网接入。美国各地的数据中心运营商正越来越多地使用移动燃气轮机为 AI 工作负载快速供电,但这些设备引发空气质量担忧,并需遵守《清洁空气法》的许可要求。

参考链接

标签: #AI infrastructure, #data centers, #environmental regulation, #energy policy, #xAI


Servo 0.4.0 发布:创纪录提交、布局改进与 WebGPU 支持 ⭐️ 7.0/10

Servo 0.4.0 于 2026 年 7 月 31 日发布,包含创纪录的 558 个提交。该版本带来了更好的布局正确性、改进的 WebGPU 支持、针对 servoshell 测试浏览器的用户增强,以及许多性能和稳定性修复。 Servo 是一个重要的独立网络引擎项目,支持开源浏览器的多样性。此版本在渲染正确性和现代 GPU Web API 方面取得了实质性进展,增强了 Servo 作为主流引擎替代方案的可行性。 该版本标记为 Servo Tech Demo 0.4.0。它包含针对 servoshell 用户的改进和真实世界兼容性修复,同时明确仍是一个测试浏览器,而非功能完整的浏览器。

rss · LWN.net · 7月31日 17:22

背景: Servo 是一款用 Rust 编写的浏览器引擎,最初由 Mozilla 开发,现在由社区独立维护。WebGPU 是 W3C 标准 API,可为 Web 应用提供高效的跨平台 GPU 访问,主流浏览器从 2023 至 2025 年陆续支持。servoshell 是 Servo 附带的用于测试和演示的小型测试浏览器。

参考链接

标签: #Servo, #web engine, #open source, #WebGPU, #browser