从 478 条内容中筛选出 25 条重要资讯。
- OpenAI 发布 GPT-5.6,推理能力提升并在 ARC-AGI 上取得突破 ⭐️ 9.0/10
- 欧盟议会通过聊天控制 1.0 ⭐️ 9.0/10
- AI 双重用途知识的可关闭开关 ⭐️ 9.0/10
- 用对抗性评分衡量超越人类水平的 AI ⭐️ 9.0/10
- AI 自我改进综述:有界与开放式 ⭐️ 9.0/10
- 机构红队测试:评估 AI 部署规则的安全性 ⭐️ 9.0/10
- 强化学习缩放定律与非单调性能排序 ⭐️ 9.0/10
- 双层神经网络鲁棒性定律得证 ⭐️ 9.0/10
- 利用潜在人格特质实现高效安全对齐 ⭐️ 9.0/10
- PLURAL:面向价值对齐的全球数据集 ⭐️ 9.0/10
- 基于内部计算图的 LLM 越狱行为机制诊断框架 ⭐️ 9.0/10
- Heimdallr:对 CI 工作流中 LLM 安全风险的首次系统研究 ⭐️ 9.0/10
- 像人类维护者一样编写代码 ⭐️ 8.0/10
- 欧盟:Facebook 和 Instagram 成瘾设计违反《数字服务法》 ⭐️ 8.0/10
- Mitchell Hashimoto 畅谈 Ghostty、Zig 与分支文化 ⭐️ 8.0/10
- NEvo 生成 AI 视频以最大化激活特定脑区 ⭐️ 8.0/10
- Agent Skills:面向 AI 编程的生产级工作流 ⭐️ 8.0/10
- Desktop Commander MCP 为 Claude 提供终端与文件控制能力 ⭐️ 8.0/10
- Claude 视频插件:让 Claude 能够观看视频 ⭐️ 8.0/10
- Kyutai 实验室发布 Pocket TTS:轻量级 CPU 运行文本转语音库 ⭐️ 8.0/10
- GitHub 仓库追踪各大 AI 聊天机器人的泄露系统提示词 ⭐️ 8.0/10
- Bun 从 Zig 重写为 Rust ⭐️ 8.0/10
- OpenAI 推出 GPT-Live 语音模式,可委托 GPT-5.5 处理复杂任务 ⭐️ 8.0/10
- 比亚迪赢得阿联酋太阳能项目全球最大单一储能合同 ⭐️ 8.0/10
- 中国网络身份证一年内达 4000 万用户 ⭐️ 8.0/10
OpenAI 发布 GPT-5.6,推理能力提升并在 ARC-AGI 上取得突破 ⭐️ 9.0/10
OpenAI 发布了其最新的旗舰 AI 模型 GPT-5.6,该模型增强了意图理解能力,并能保留原始图像尺寸。该模型在 ARC-AGI-3 基准测试中取得了 7.8% 的最新最优成绩,成为首个通过验证击败 ARC-AGI 游戏的前沿模型。 此次发布标志着 AI 推理和泛化能力的重大进步,是迈向通用人工智能的关键一步。新模型在 ARC-AGI(一个对人类简单但对 AI 困难的基准测试)上的表现提升,表明在分布外推理和抽象方面取得了进展。 根据开发者指南,GPT-5.6 能更好地推断用户的潜在目标,并保持原始图像尺寸而不缩小。然而,社区测试显示在复杂的智能体评估中结果参差不齐,OpenAI 还将 Fable 5 模型排除在部分生物医学基准测试之外,因为它拒绝回答大多数问题。
hackernews · OpenAI News · 7月9日 17:04 · 社区讨论
背景: ARC-AGI 基准测试由 François Chollet 创建,通过抽象推理任务衡量 AI 从少量示例中泛化的能力。它被设计为对人类简单但对 AI 困难,重点关注分布外推理。7.8% 的分数表明 GPT-5.6 能解决其中一些任务,这是前沿模型首次做到。
社区讨论: 社区反应不一:一些人称赞 ARC-AGI 的成就是一个重要里程碑,而另一些人则报告在复杂评估中性能不一致。还有人讨论 OpenAI 将某些模型排除在基准测试之外的做法,以及与 Claude Code 等工具的比较。
标签: #AI, #Large Language Models, #OpenAI, #Safety, #ARC-AGI
欧盟议会通过聊天控制 1.0 ⭐️ 9.0/10
欧洲议会通过了“聊天控制 1.0”,允许在 2028 年前对主要平台上的私人信息进行无证扫描。尽管多数投票议员反对,但因程序规则要求绝对多数才能否决,该措施仍然获得批准。 这标志着欧盟数字政策的重大转变,允许在没有司法监督的情况下对私人通信进行大规模监控。它破坏了端到端加密,为隐私权树立了危险先例,影响数百万用户使用的 Instagram、Discord、Gmail 和 iCloud 等平台。 投票于 2026 年 7 月 9 日(暑假前一天)举行,结果 314 票反对、276 票赞成、17 票弃权、113 票缺席。否决动议需要 361 票(全体议员的绝对多数),因此未能通过。聊天控制 1.0 在 2026 年 3 月曾两次被否决,但欧盟委员会将其保留。
hackernews · rapnie · 7月9日 11:03 · 社区讨论
背景: 聊天控制是一系列旨在扫描通信中儿童性虐待材料(CSAM)的欧盟拟议法律。聊天控制 1.0 允许对私人信息进行客户端扫描,这可能会破坏端到端加密。更广泛的聊天控制 2.0 仍在讨论中。批评者认为这种监控侵犯基本权利,且对保护儿童无效。
参考链接
社区讨论: 评论者普遍谴责该程序不民主,指出投票在假期前一天举行,且多数投票议员反对该措施。一些人指出,委员会在提案被击败后拒绝撤回,导致进入二次阅读程序,而否决需要绝对多数。舆论情绪强烈负面,许多人称欧盟为威权组织。
标签: #privacy, #surveillance, #EU law, #digital rights, #encryption
AI 双重用途知识的可关闭开关 ⭐️ 9.0/10
Anthropic 研究团队提出一种新方法,能够选择性地禁用 AI 模型中危险的双重用途能力,同时保留良性功能,相当于为有害知识设置了一个’关闭开关’。 这项研究解决了 AI 安全的一个关键问题:模型即使初衷良好,也可能被滥用于有害目的。此方法有望促进强大 AI 系统的安全部署,并影响监管框架。 该方法利用表征工程技术来隔离并停用特定的知识路径,同时保持模型的整体性能不受影响。它不需要完全重新训练,并能在良性任务上保持模型的有效性。
rss · Anthropic Research · 7月8日 21:46
背景: 双重用途技术指既能用于民用也能用于军事目的的技术。在 AI 领域,双重用途知识包括网络安全专业知识,既可防护也可攻击系统。传统的 AI 安全方法往往广泛限制能力,而此方法允许选择性抑制有害应用,同时保留有用功能。
标签: #AI safety, #dual-use knowledge, #Anthropic, #model control, #responsible AI
用对抗性评分衡量超越人类水平的 AI ⭐️ 9.0/10
研究人员提出了一种称为对抗性心理测量评分的相对测量框架,利用 AI 生成的挑战来评估超越人类水平的智能。 这一范式转变解决了基准饱和问题——随着 AI 在静态测试中超越人类表现,该问题日益突出——并可能为高级 AI 提供可扩展、客观的评估。 该框架包含减少私人信息攻击的协议,支持无裁判裁决,并能随着代理能力自然扩展,适用于可验证和开放式领域。
rss · arXiv cs.AI · 7月9日 04:00
背景: 当前的 AI 基准(如 ImageNet 或 GLUE)因模型达到近乎满分而面临饱和,难以区分进展。该提议的方法从绝对测量转向相对测量,让模型相互挑战以揭示能力差异。
标签: #AI evaluation, #benchmark saturation, #psychometric rating, #adversarial measurement, #AI safety
AI 自我改进综述:有界与开放式 ⭐️ 9.0/10
本综述全面回顾了 2024 至 2026 年间 1,250 篇 arXiv 论文,提出了一种分类法,区分有界自我完善与开放式递归自我改进。 它为这个快速发展的领域提供了结构化地图,澄清了模糊术语,并突出强调了关键安全与能力挑战,特别是评估器设计和测量方面。 该综述引入了自我改进信号的验证层次结构,从形式验证器(最强)到内在自我评估(最弱),并指出自我确认循环等失败模式与此层次结构的违背相对应。
rss · arXiv cs.AI · 7月9日 04:00
背景: 有界自我完善指在固定标准内改进系统,已在实践中使用(如 SELF-REFINE)。开放式递归自我改进旨在改进改进过程本身,可能导致智能爆炸。该综述重点探讨评估器设计作为关键瓶颈。
参考链接
标签: #AI safety, #recursive self-improvement, #AI alignment, #survey, #capabilities
机构红队测试:评估 AI 部署规则的安全性 ⭐️ 9.0/10
机构红队测试是一种全新的评估方法论,用于测试多智能体 AI 系统中的部署规则,结果表明仅改变后果规则就会导致各群体死亡率变动 22 至 58 个百分点,且不存在普遍安全的默认规则。 这项工作将 AI 安全关注点从模型层面转向规则层面,提供了部署规则因果关系影响集体结果的实证证据,并强调了针对具体情境进行安全认证的必要性,这对 AI 治理和政策具有深远意义。 该方法论在 IABench-CA 基准中实例化,这是一个涵盖 228 个情境、五种规范规则和七个模型群体(共 33,924 场游戏)的后果分配基准,包含自动标注的推理轨迹和规范性合作参考。一个关键发现是身份显著性驱动了目标锁定:在一次性消融实验中,匿名化使定向消除率从 22%跃升至 81%。
rss · arXiv cs.AI · 7月9日 04:00
背景: 红队测试是一种安全实践,通过模拟对抗性攻击来识别漏洞。在 AI 安全领域,红队测试传统上聚焦于模型本身。本文将该概念扩展为“机构红队测试”,通过评估多智能体部署中的规则,将这些规则视为影响集体安全结果的因果因素。
标签: #AI safety, #multi-agent systems, #red-teaming, #deployment rules, #evaluation methodology
强化学习缩放定律与非单调性能排序 ⭐️ 9.0/10
一篇新论文引入了强化学习中缩放定律的理论基础,并通过实验证明算法性能排名在不同数据规模下是非单调的。 这挑战了强化学习评估中的常见假设,可能重塑研究人员设计和比较算法的方式,从而催生更稳健、可扩展的强化学习方法。 作者进行了大规模实验,表明经典评估范式导致了错误结论,并提供了关于深度强化学习缩放、能力和复杂性的核心分析。
rss · arXiv cs.LG · 7月10日 04:00
背景: 机器学习中的缩放定律描述模型性能如何随计算或数据增加而可预测地提升。在强化学习中,由于回报不是平滑函数,建立类似定律具有挑战性。这项工作将缩放定律概念扩展到强化学习,并揭示了非单调排序,即小数据集上的最佳算法可能不适用于大数据集。
标签: #reinforcement learning, #deep RL, #scaling laws, #evaluation, #deep neural networks
双层神经网络鲁棒性定律得证 ⭐️ 9.0/10
研究人员证明了一个长期存在的猜想:对于通用数据,任何拟合 n 个含噪标签的双层神经网络,其 Lipschitz 常数必须至少达到 sqrt(n/m) 量级,且对权重大小无任何限制,仅差一个对数因子。 这解决了深度学习理论中的一个关键猜想,为网络规模、鲁棒性和泛化能力之间提供了严谨的联系,对设计更鲁棒和可解释的神经网络具有重要意义。 该证明适用于 ReLU 网络及其他连续分段线性激活函数,覆盖从球面或高斯分布中均匀采样的数据,并包含一个 d=2 时的明确反例,表明该定律在低维度下不成立。
rss · arXiv cs.LG · 7月10日 04:00
背景: Lipschitz 常数衡量函数在输入微小扰动下输出变化程度,是神经网络鲁棒性和泛化能力的关键指标。鲁棒性定律猜想网络规模(宽度)与鲁棒性之间存在基本权衡:拟合含噪数据时,网络必须有足够多的参数才能保持鲁棒。
参考链接
标签: #deep learning theory, #robustness, #neural networks, #Lipschitz constant, #generalization
利用潜在人格特质实现高效安全对齐 ⭐️ 9.0/10
研究人员提出了潜在人格对齐(LPA)方法,仅使用 66 条心理测量语句就在 HarmBench 上实现了近乎为零的攻击成功率,且无需在有害内容上训练或牺牲性能。 该方法提供了一种轻量级、高效的安全对齐替代方案,解决了 LLM 的关键脆弱性,有望以最小计算开销实现更稳健的 AI 系统。 LPA 在无害的人格陈述上进行对抗训练,所需示例比标准 LAT 少 75 倍,且可在单张 GPU 上数分钟内完成训练。
rss · arXiv cs.CL · 7月10日 04:00
背景: 当前大型语言模型(LLM)的安全方法通常容易受到对抗性‘越狱’攻击。潜在对抗训练(LAT)是一种先前的防御方法,通过扰动潜在表示来增强鲁棒性,但需要大量有害提示数据集且可能降低效用。HarmBench 是一个用于 LLM 自动化红队测试的标准化评估框架。
参考链接
标签: #AI safety, #adversarial robustness, #large language models, #alignment, #latent representations
PLURAL:面向价值对齐的全球数据集 ⭐️ 9.0/10
研究人员发布了 PLURAL,这是一个基于涵盖 92 个国家的综合价值观调查生成的大规模偏好数据集,包含约 50 万个偏好三元组,旨在使 LLM 与多元文化价值观对齐。 PLURAL 通过提供可扩展的多元对齐资源来解决 LLM 中的文化偏见,将对齐误差降低高达 27.7%,并被印度、巴西和日本的人类评估者认为更能代表其国家价值观。 该数据集使用两阶段生成流水线,将调查响应转换为合成偏好三元组,同时保留规范价值信号。目前覆盖 20 个具有多样性的国家,计划扩展到全部 92 个国家。
rss · arXiv cs.CL · 7月10日 04:00
背景: 综合价值观调查(IVS)整合了欧洲价值观研究和世界价值观调查的数据,涵盖数十年的跨国家价值观研究。偏好三元组用于直接偏好优化(DPO),基于人类偏好微调 LLM。PLURAL 利用这种方法将文化价值信号注入 LLM。
参考链接
标签: #AI alignment, #value alignment, #dataset, #cultural diversity, #LLM
基于内部计算图的 LLM 越狱行为机制诊断框架 ⭐️ 9.0/10
一篇新论文提出了一个机制性框架,通过配对的内部计算图分析对抗性提示如何改变 LLM 的内部推理,从而实现对漏洞的因果诊断。 该方法超越了输入输出分析,揭示了与不安全行为相关的内部计算结构偏差,有望提升 LLM 的安全性和鲁棒性。 该框架将计算分解为不变、抑制和涌现结构,识别反复出现的漏洞模式,并对节点和子图进行因果干预以评估攻击成功的贡献。
rss · arXiv cs.CR · 7月10日 04:00
背景: 机制可解释性旨在通过分析神经网络的内部电路和特征来逆向工程。对抗性越狱攻击利用 LLM 漏洞来引发有害响应。现有方法主要通过输入输出行为研究这些攻击,对内部推理变化的洞察有限。
参考链接
标签: #interpretability, #LLM safety, #adversarial attacks, #mechanistic interpretability
Heimdallr:对 CI 工作流中 LLM 安全风险的首次系统研究 ⭐️ 9.0/10
研究人员发布了首个系统性研究和检测框架 Heimdallr,用于识别 GitHub CI 工作流中因集成 LLM 而产生的安全风险,包括风险分类法和混合分析工具,已在 759 个仓库中检测到 802 个易受攻击的工作流实例。 随着 LLM 越来越多地集成到 CI 工作流中,这项工作填补了理解和缓解新型攻击面的关键空白,对软件供应链安全和负责任披露具有实际影响。 Heimdallr 在 300 个手动标注的独特工作流上实现了高精度:LLM 节点识别(F1 约 0.994)、触发可能性分类(99.8%)和威胁向量检测(微平均 F1 约 0.917)。
rss · arXiv cs.CR · 7月10日 04:00
背景: GitHub CI 工作流自动化软件的构建、测试和部署,并且越来越多地集成 LLM 用于代码审查、问题分类等任务。这种集成创造了新的攻击面:外部可控的工作流输入可以操纵 LLM 输出,可能影响安全决策或仓库状态。论文引入了一种 LLM 工作流属性图(L-WPG)来建模这些交互,并将静态分析与 LLM 辅助的数据流摘要相结合。
标签: #LLM security, #CI/CD security, #GitHub Actions, #prompt injection, #software supply chain
像人类维护者一样编写代码 ⭐️ 8.0/10
文章主张开发者应优先考虑代码对人工审查者的可读性和可维护性,而非优化 AI 代码生成工具。 随着 LLM 辅助编码的普及,这一观点指出了 AI 生成的模板代码和不良抽象可能破坏代码库的风险,敦促开发者保持高标准。 文章警告说,LLM 倾向于重复现有模式而非创建清晰的抽象,导致重复代码和维护负担增加。
hackernews · ScottWRobinson · 7月10日 13:33 · 社区讨论
背景: 像 GitHub Copilot 和 Claude 这样的 AI 编码助手能快速生成大量代码,但这些代码可能不遵循可读性和可维护性的最佳实践。开发者通常依赖代码审查来发现问题,但 AI 生成的代码量之大可能降低审查效果。
社区讨论: 评论者分享了实用技巧,如使用包含检查清单的/review 命令指导 LLM 代理,并讨论了 LLM 是否固有地偏向重复结构而非抽象。一些人警告过度依赖 LLM 会随时间推移降低代码库质量。
标签: #code generation, #maintainability, #AI assistants, #software engineering, #LLM development
欧盟:Facebook 和 Instagram 成瘾设计违反《数字服务法》 ⭐️ 8.0/10
欧盟委员会初步认定 Meta 旗下的 Instagram 和 Facebook 因采用无限滚动和自动播放等成瘾性设计,违反《数字服务法》(DSA),可能导致用户强迫性使用。 这是 DSA 首次针对算法成瘾的重大执法行动,为欧洲社交媒体平台规范暗黑模式树立了先例。 欧盟委员会批评 Meta 的时间管理工具容易被忽略,家长控制需要投入大量精力,并警告若不整改将面临罚款。
hackernews · jeroenhd · 7月10日 11:00 · 社区讨论
背景: 《数字服务法》(DSA)是欧盟的一项里程碑式法规,要求大型在线平台评估并缓解系统性风险,包括成瘾性设计。成瘾性设计模式利用算法最大化用户参与度,常导致强迫性行为。DSA 于 2024 年 2 月全面生效。
参考链接
社区讨论: 评论者对这一做法展开讨论:有人主张强制执行成瘾算法与伦理算法之间的选择,也有人指出现有的时间弹窗等缓解措施无效。还有用户建议重置 Instagram 算法作为实用步骤。
标签: #digital-services-act, #regulation, #social-media, #algorithmic-addiction, #EU
Mitchell Hashimoto 畅谈 Ghostty、Zig 与分支文化 ⭐️ 8.0/10
Mitchell Hashimoto 在一次访谈中分享了他使用 Zig 语言构建 Ghostty 终端模拟器的经历,比较了不同语言的文化,并提倡更多的软件分支。 此次访谈提供了一位知名开发者在选择 Zig 而非 Rust 时的实际考量,并强调了分支作为健康开源实践的重要性,对开发者社区具有启发意义。 Ghostty 是一款跨平台、GPU 加速的终端模拟器,使用原生 UI 构建。Hashimoto 指出 Zig 在技术和社区方面具有两极分化的立场,但对其不妥协的态度表示尊重。
hackernews · veqq · 7月9日 17:17 · 社区讨论
背景: Zig 是一种通用系统编程语言,旨在改进 C 语言,具有手动内存管理和编译时泛型。Ghostty 是一个快速、功能丰富的终端模拟器,使用 GPU 加速和原生 UI。访谈涵盖了 Hashimoto 对语言文化的看法以及软件分支的好处。
参考链接
社区讨论: 评论者赞赏 Hashimoto 深思熟虑且务实的方法。有人讨论了 Rust 社区的名声以及维护分支的实际负担,而其他人则认为这次访谈鼓舞人心且富有见地。
标签: #Zig, #Ghostty, #Mitchell Hashimoto, #programming languages, #terminal emulator
NEvo 生成 AI 视频以最大化激活特定脑区 ⭐️ 8.0/10
EPFL 的研究人员推出了 NEvo,这是一种神经引导的进化算法,能够合成 AI 生成的视频,以最大化刺激视觉皮层中的目标脑区。该系统利用数字孪生(编码模型)进化出比自然视频产生更强神经反应的视频。 NEvo 为神经科学提供了一种强大的新工具,以更少的实验者偏差来绘制视觉选择性,可能有助于更好地理解大脑功能。同时,它也引发了关于 AI 生成内容可能用于媒体或脑机接口中定向神经操控的伦理思考。 NEvo 使用遗传算法进化两秒长的视频片段,该算法由基于受试者观看视频时的 fMRI 数据训练的编码模型引导。测试表明,NEvo 生成的视频对大脑的刺激强于最佳自然视频或特选静态帧。
hackernews · smusamashah · 7月10日 07:39 · 社区讨论
背景: 视觉皮层由多个区域组成,它们对运动、面孔或场景等视觉特征有选择性反应。功能性磁共振成像(fMRI)可测量大脑活动,但传统实验依赖手动挑选的刺激,可能引入偏差。NEvo 通过使用能预测任何视频神经反应的编码模型,优化视频以最大化激活特定体素或感兴趣区域(ROI),从而自动化刺激生成。
参考链接
社区讨论: 评论者既表达了兴奋也表示了担忧:一些人强调该工具在无偏神经科学研究中的潜力,而另一些人则警告其在社交媒体或精神控制中的反乌托邦应用。技术澄清指出,NEvo 是一种研究工具,需要个体的编码模型,并非通用的脑控设备。
标签: #AI, #neuroscience, #brain-computer interface, #research tools
Agent Skills:面向 AI 编程的生产级工作流 ⭐️ 8.0/10
Addy Osmani 发布了“agent-skills”开源仓库,将 24 项生产级工程技能打包给 AI 编码智能体,可通过斜杠命令或 skills CLI 使用。 该仓库编码了高级工程师的工作流程和质量门,使 AI 智能体能在各开发阶段遵循一致的最佳实践,可显著提升代码质量并减少人工监督。 该仓库包含 8 个映射到开发生命周期的斜杠命令(如/spec、/plan、/build、/test、/review、/ship),并通过 skills CLI 支持超过 70 个 AI 编码智能体,包括 Cursor、Claude Code 和 Copilot。
rss · GitHub Trending - Daily · 7月10日 17:49
背景: AI 编码智能体是协助开发者完成代码生成、审查和测试等任务的工具。质量门是开发流水线中强制执行代码标准的检查点。该仓库将高级工程师工作流程打包成可复用的技能,结合了这两个概念。
标签: #AI agents, #software engineering, #best practices, #developer tools
Desktop Commander MCP 为 Claude 提供终端与文件控制能力 ⭐️ 8.0/10
Desktop Commander MCP 是一个新的 Model Context Protocol 服务器,让 Claude 能够控制终端、搜索文件系统,并通过基于 diff 的方式编辑文件。 该工具显著扩展了 Claude 的自主能力,使其能够直接在用户机器上运行命令、管理代码和自动化任务,超越了传统 AI 编辑器的局限。 该 MCP 服务器可与 Claude Desktop 及其他 MCP 客户端配合使用,并已通过 AgentAudit 验证。还提供了配套的 Desktop Commander 应用(测试版),支持多种 AI 模型,体验更完善。
rss · GitHub Trending - Daily · 7月10日 17:49
背景: Model Context Protocol(MCP)是 Anthropic 于 2024 年 11 月推出的开放标准,用于规范 AI 应用连接外部工具和数据源的方式。MCP 让 Claude 等 AI 代理无需自定义集成即可接入工具。Diff 文件编辑是指对文件进行增量修改而非整体重写,这种方式更高效、更精确。
参考链接
标签: #MCP, #Claude, #AI Agent, #Terminal Control, #File Management
Claude 视频插件:让 Claude 能够观看视频 ⭐️ 8.0/10
开源插件 claude-video 使 Claude 能够下载视频、提取帧并转录音频,让 Claude 以图像和文本形式分析视频内容。 这极大扩展了 Claude 的多模态能力,支持视频摘要、屏幕录制错误诊断和内容分析等用例,无需人工观看。 它使用 yt-dlp 下载和提取字幕,ffmpeg 提取帧,并在字幕不可用时可选 Whisper API 进行转录。
rss · GitHub Trending - Daily · 7月10日 17:49
背景: Claude 是 Anthropic 开发的 AI 助手,能浏览网页和运行代码,但缺乏原生视频理解能力。yt-dlp 是一个流行的开源工具,可从超过 1000 个网站下载视频;Agent Skills 是一种开放格式,用于通过专门工作流扩展 AI 代理能力。
标签: #AI, #Claude, #Video, #Open Source, #Tool
Kyutai 实验室发布 Pocket TTS:轻量级 CPU 运行文本转语音库 ⭐️ 8.0/10
Kyutai 实验室开源了 Pocket TTS,这是一个轻量级的文本转语音库,可在 CPU 上高效运行,通过 pip 一键安装。它支持多种语言、语音克隆,并可实现低至 200 毫秒的音频流式输出。 Pocket TTS 通过消除对 GPU 或云 API 的需求,使高级语音合成民主化,在消费级硬件上即可运行。其仅依赖 CPU 推理和小型模型(1 亿参数),支持离线、私密和实时的语音生成,适用于多种应用场景。 该模型拥有 1 亿参数,运行速度快于实时(例如在 MacBook Air M4 上仅使用 2 个 CPU 核心即可达到约 6 倍实时速度),支持英语、法语、德语、葡萄牙语、意大利语和西班牙语。它还提供语音克隆、无限长文本输入以及客户端浏览器运行能力。
rss · GitHub Trending - Daily · 7月10日 17:49
背景: 传统的文本转语音系统通常需要 GPU 加速或基于云的 API,限制了它们在边缘设备和隐私敏感场景中的使用。Pocket TTS 是一个针对 CPU 优化的模型,无需专用硬件即可实现低延迟和高吞吐量,适用于台式机、笔记本电脑甚至网页浏览器。该项目附有技术报告和 arXiv 论文。
标签: #TTS, #open-source, #CPU inference, #PyTorch, #lightweight
GitHub 仓库追踪各大 AI 聊天机器人的泄露系统提示词 ⭐️ 8.0/10
用户 asgeirtj 创建的 GitHub 仓库 ‘system_prompts_leaks’ 一直在收集和记录来自 Claude、ChatGPT、Gemini 等主要 AI 聊天机器人的泄露系统提示词,并定期更新至 2026 年 7 月。 该仓库为理解流行 AI 模型的隐藏指令提供了前所未有的透明度,使研究人员、开发者和公众能够了解模型行为、安全约束和对齐技术。被《华盛顿邮报》报道凸显了其对 AI 问责制的重要性。 该仓库包含来自 Claude Fable 5、Opus 4.8、ChatGPT 5.5 Thinking、GPT-5.5 Codex、Gemini 3.5 Flash 等多种模型的泄露提示词,以及版本间的差异对比。还包括 Claude Design 等工具的提示词,其中包含 48 个工具和 16 项技能。
rss · GitHub Trending - Daily · 7月10日 17:49
背景: 系统提示词是赋予 AI 模型的隐藏指令,用于定义其行为、个性、约束和能力。公司通常不公开这些内容,因此泄露信息对透明度很有价值。该仓库是一个众包存档,类似于其他提示工程资源,但专注于实际生产环境中的提示词而非用户编写的提示词。
标签: #AI, #system prompts, #transparency, #chatbot, #alignment
Bun 从 Zig 重写为 Rust ⭐️ 8.0/10
Jarred Sumner 宣布将 Bun JavaScript 运行时从 Zig 完全重写为 Rust,原因是持续存在的内存管理错误,包括释放后使用和重复释放。重写耗时 11 天,采用基于大语言模型的代理工程方法,API 令牌费用估计为 16.5 万美元。 此次重写表明,长期以来被认为风险极高的大规模软件重写如今借助 AI 辅助的代理工程变得可行。同时,它凸显了 Rust 在混合使用垃圾回收和手动管理内存的场景下,在内存安全方面的优势。 移植过程利用了 Bun 现有的 TypeScript 测试套件作为符合性测试套件,使得新 Rust 代码可以通过数百万个断言进行自动验证。基于 Rust 的新 Bun 自 2025 年 6 月起已在 Claude Code 中部署,Linux 上启动速度提升 10%,且用户未察觉变化。
rss · Simon Willison · 7月8日 23:57
背景: Bun 是一个快速的 JavaScript 运行时,最初使用 Zig 编写,Zig 是一种提供手动内存管理的底层编程语言。Rust 是另一种系统级语言,通过所有权模型和借用检查器在编译时强制内存安全。代理工程是一种现代软件开发实践,AI 智能体在人类监督下自主规划、编写和测试代码。此次重写得益于能够生成和审查大型代码库的前沿 AI 模型。
参考链接
标签: #Bun, #Rust, #Zig, #JavaScript runtime, #software engineering
OpenAI 推出 GPT-Live 语音模式,可委托 GPT-5.5 处理复杂任务 ⭐️ 8.0/10
OpenAI 正式发布了 GPT-Live,这是 ChatGPT 的升级版语音模式,能够在保持对话流畅的同时将复杂任务委托给前沿模型 GPT-5.5。 此次升级显著提升了 ChatGPT 的语音模式,通过利用更强大的模型(GPT-5.5)并实现不中断对话的任务委托,使其成为更有用的头脑风暴伙伴。 之前的语音模式基于 GPT-4o 时代的旧模型,知识截止于 2024 年;GPT-Live 在发布时后台使用 GPT-5.5,并将随着未来前沿模型的发布而更新。早期模型中存在的一个打断用户笑声的 bug(即使并非玩笑)据报道已被修复。
rss · Simon Willison · 7月8日 23:20
背景: GPT-Live 是 OpenAI 推出的新型语音模式模型,为 ChatGPT 提供实时语音对话能力。它将较难的任务委托给 GPT-5.5,后者是 2026 年 4 月发布的前沿大型语言模型,以增强的推理能力和可靠性著称。之前的语音模式因底层模型较旧而能力受限。
标签: #OpenAI, #GPT-Live, #voice mode, #ChatGPT, #AI update
比亚迪赢得阿联酋太阳能项目全球最大单一储能合同 ⭐️ 8.0/10
比亚迪储能与阿联酋能源巨头 Masdar 签署协议,为阿布扎比的“全天候”光储项目提供 11.275 GWh 的储能解决方案,这是有史以来最大的单一储能采购合同之一。 该合同标志着全球储能行业的一个重要里程碑,证明了大规模光储系统提供全天候基荷可再生能源电力的可行性。它凸显了比亚迪等中国公司在全球能源转型中的领先地位。 比亚迪将部署其“浩瀚”储能系统,该系统采用全球最大的 2710Ah 储能专用刀片电池,使电池管理系统复杂度降低 70%-80%。该系统在 20 英尺集装箱内提供 10 MWh 容量,并具有 IP66 防护等级以适应严酷的沙漠环境。
rss · IT HOME · 7月10日 13:40
背景: 太阳能具有间歇性,只有在有阳光时才能发电。为了提供可靠的基荷电力,需要大规模电池储能。RTC 项目旨在将一座 5.2 GW 的光伏电站与一个 19 GWh 的电池系统相结合,全天候提供 1 GW 的连续清洁电力,这是吉瓦级规模的首创。
参考链接
标签: #energy storage, #renewable energy, #solar power, #BYD, #infrastructure
中国网络身份证一年内达 4000 万用户 ⭐️ 8.0/10
《国家网络身份认证公共服务管理办法》实施一年后,已有 4000 万人申领数字身份,530 余个应用和网站接入,累计提供网络身份认证 2.8 亿次。 这一里程碑表明中国在构建统一的国家数字身份基础设施方面取得进展,有助于增强网络安全、减少个人数据泄露,并简化政府、金融、医疗和旅游等多个领域的身份认证流程。 该服务自愿且免费,微信、淘宝、京东等主流平台已支持一键登录。已出台 8 部法律法规和 7 项技术标准作为支撑。用户可通过手机 App 或轻量化小程序申领,无 NFC 功能的手机可借用他人设备完成首次申领。
rss · IT HOME · 7月10日 12:27
背景: 国家网络身份认证服务基于法定身份证件发放“网号”(唯一标识符)和“网证”(包含网号及非明文身份信息的凭证),使用户在网络上验证身份时无需向第三方平台直接透露真实姓名或身份证号,从而实现“实名不显名”的认证。
标签: #digital identity, #cybersecurity, #data privacy, #authentication, #China policy