LoopDNS资讯播报
70.5K subscribers
2.71K photos
355 videos
132 files
7.93K links
LoopDNS 综合资讯---简洁,及时,快速,准确


频道: @DNSPODT

电报讨论组: @LoopDNS

撤稿流程: https://t.iss.one/loopdns/107752
Download Telegram
韩国KOSPI指数跌超8%,触发熔断机制,暂停交易20分钟。
😁65🤡18🤮21👍1
LoopDNS资讯播报
月之暗面正式发布 Kimi K3 模型权重 月之暗面已在 Hugging Face 正式发布 Kimi K3 的完整模型权重,兑现了此前“最晚于 7 月 27 日开放权重”的承诺。配套的模型代码、技术报告和部署说明也已同步公开。 Kimi K3 采用混合专家架构,总参数量为 2.8 万亿,每次推理激活约 1040 亿参数。模型包含 896 个专家,每个 Token 选择其中 16 个专家,支持最高 100 万 Token 上下文,并具备原生图像理解能力。官方发布的是经过量化感知训练的 MXFP4 权重,Hugging…
与 K2 相比,K3 的层数从 61 层增加到 93 层,总参数量从 1.04 万亿增加到 2.78 万亿,激活参数从 326 亿增加到 1042 亿。路由专家数量由 384 个增加到 896 个,每个 Token 激活的专家数量由 8 个增加到 16 个,共享专家由 1 个增加到 2 个,注意力头则从 64 个增加到 96 个。

K3 的隐藏层维度仍然保持在 7168,没有通过继续扩大模型宽度来完成扩展。它主要增加了网络深度、专家数量和每个 Token 实际调用的专家容量。这意味着“2.8 万亿参数”代表模型可容纳的总体参数规模,而不是每次推理都需要执行全部参数。每个 Token 实际运行的是约 1042 亿参数,但这一激活规模本身仍然相当于一个大型稠密模型。

Kimi K3 的注意力结构采用 Kimi Delta Attention 与 Gated MLA 混合设计。每个主要模块由三层 KDA 和一层 Gated MLA 组成,完整模型共包含 69 层 KDA 和 24 层 MLA。KDA 使用固定大小的递归状态保存历史信息,避免像标准注意力一样为所有历史 Token 持续保存完整的键值缓存,主要负责处理长序列;MLA 则周期性执行全局注意力,保留任意 Token 之间的直接交互能力。

这意味着 K3 并不是一款完全依赖线性注意力的模型。KDA 可以控制百万上下文下的缓存增长,但 24 层 MLA 的缓存仍然会随着序列长度增加。K3 的设计更接近一种折中方案:多数层使用适合超长序列的递归注意力,少数层保留完整全局交互,以减少纯线性注意力在复杂信息检索和全局关联上的能力损失。

K3 的 MLA 层没有使用 RoPE 等显式位置编码,而是依赖前置 KDA 层产生的位置和时序信息。这样做可以避免扩展上下文时重新调整 RoPE 基频或执行位置插值。不过,百万 Token 能力并不是仅依靠 NoPE 自动获得的。K3 在训练中仍采用了分阶段上下文课程,窗口先从 8000 Token 扩展到 6.4 万 Token,随后在冷却训练阶段继续扩展到 25.6 万和 100 万 Token。

由于自然存在的百万 Token 高质量文档和视频数量有限,团队还合成了一批长上下文数据,将多个文档、图像和子任务重新组合,使答案必须依赖分散在完整上下文中的信息。报告强调,仅增加输入长度并不能让模型真正形成长距离能力,训练数据必须迫使模型跨越完整上下文进行检索和推理。

在模型深度方向,K3 引入了 Attention Residuals。传统残差连接会把此前所有层的信息持续压缩到同一个隐藏状态中,随着模型加深,早期信息可能被逐渐覆盖。Attention Residuals 把不同层的输出视为可以被后续层选择读取的信息源,让模型能够从嵌入层和此前模块中动态选择所需表示。

考虑到完整保存 93 层输出会带来较高内存和通信开销,K3 使用了分块版本的 Block Attention Residuals。模型将不同层划分为多个模块,模块内部先汇总信息,模块之间再执行选择性读取。这种设计试图在深层信息流和实际训练成本之间取得平衡。

在混合专家部分,K3 使用 Stable LatentMoE。模型共有 896 个路由专家,每个 Token 选择其中 16 个专家,同时保留两个全宽度共享专家。路由分支会先把 7168 维隐藏状态投影到 3584 维潜在空间,再执行专家计算,之后重新映射回完整隐藏维度。

这一设计降低了同时激活大量专家所需的通信量和权重读取成本,但也会引入训练稳定性问题。为此,K3 在专家聚合后增加 RMSNorm,并提出 SiTU-GLU 激活函数,对门控分支和上投影分支进行平滑限幅。按照报告给出的参数设置,单个输出坐标的理论幅度上限为 100,用于减少超大激活值和低精度计算溢出的风险。

团队还提出 Quantile Balancing,用于解决近 900 个专家之间的负载不均衡问题。传统方法通常按照专家过载或闲置情况,以固定步长逐渐修正路由偏置。Quantile Balancing 则根据全局路由分数的分位数直接计算下一步偏置,使每个专家接收的 Token 数尽量接近目标负载。

对于大规模 MoE 模型,专家负载平衡不仅影响模型训练,还直接决定集群利用率。只要部分专家持续过载,其他 GPU 就可能等待最慢的设备完成计算。K3 使用全局直方图近似计算分位数,从而避免收集数百万 Token 的完整路由分数,同时保持较低的通信成本。

报告称,架构、训练数据、优化器和训练配方的联合改进,使 K3 相比 K2 获得约 2.5 倍的整体扩展效率。这里的“2.5 倍”指的是在验证损失与训练计算量的拟合曲线上,达到相近验证损失所需的计算量有所下降,并不代表 K3 的推理速度比 K2 快 2.5 倍,也不意味着所有下游任务的单位成本都提高了相同比例。

这项结果还是多种改动共同产生的,包括 KDA、Attention Residuals、Stable LatentMoE、训练数据调整、Per-Head Muon 优化器以及超参数重新搜索。报告没有提供足够完整的逐项消融实验,因此目前无法明确判断每项技术分别贡献了多少。

Kimi K3 同时是一款原生多模态模型。其视觉编码器 MoonViT-V2 共有 27 层,参数量约为 4.01 亿。与先训练语言模型、再连接一个已经完成对比学习的视觉编码器不同,MoonViT-V2 从头开始参与统一的下一 Token 预测训练,文本、图像和视频数据共同进入同一个模型骨干。

团队表示,使用 SigLIP 初始化的视觉编码器在联合训练中出现了更高且更频繁的梯度尖峰,而从头训练的 MoonViT-V2 更加稳定,并在视觉评测中取得相近结果。K3 的图像和视频使用同一套视觉参数,视频注意力被拆分为空间和时间两个方向。模型还通过像素重排,将视觉 Token 数量缩减到原来的四分之一,最高可处理 3584×3584 分辨率的输入。

K3 的后训练过程由监督微调、强化学习和多教师在线蒸馏组成。团队分别在通用任务、通用智能体和编码智能体三个领域训练策略,每个领域再训练 low、high 和 max 三种推理强度,总计形成九个教师模型,最后通过 Multi-Teacher On-Policy Distillation 合并到一个统一模型中。

不同推理强度并不是简单调整最大输出长度。训练系统会根据冷启动模型为每个问题估计基础预算,超过预算的轨迹会受到负奖励。团队先训练预算较高的 max 模型,再逐步压缩预算,得到 high 和 low 版本。因此,不同推理强度在一定程度上代表经过强化学习形成的不同行为策略,而不只是服务端设置的 Token 上限。

为了训练持续数百甚至数千次工具调用的智能体任务,K3 使用了部分轨迹生成机制。系统不再等待所有强化学习轨迹全部结束,而是在一定比例的任务完成后先开始更新模型,其余任务暂停并在后续训练迭代中继续执行。一条超长任务可以跨越多个训练周期,代价是部分数据会变得陈旧,因此训练算法会限制每次策略更新幅度。

K3 的强化学习环境没有绑定单一智能体框架。团队将工具接口、系统提示、上下文管理、记忆、技能和子智能体等能力拆分成可组合模块,可以模拟 Kimi Code、Claude Code、Codex、OpenClaw 和 Hermes 等不同运行方式。这样做的目的,是减少模型对特定工具名称、提示格式和上下文压缩方法的依赖。

训练任务覆盖复杂搜索、专业知识工作、软件工程、GPU 内核优化、网页开发、视觉推理、长期个人助理和自主执行任务。个人助理环境模拟了 Gmail、Notion、Slack 和 Canvas 等应用,一条轨迹可以跨越多个模拟日期,包含数千次工具调用和数百万累计上下文 Token。

K3 的基础设施部分是技术报告中信息最集中的内容之一。团队为 KDA 开发了 FlashKDA 内核和 KDA Context Parallelism,将长序列拆分到不同设备,同时只交换固定大小的递归状态,而不是随上下文长度增长的完整键值块。

MoE 训练则使用 MoonEP 动态复制少量专家,使每个专家并行设备接收完全相同数量的 Token。负载固定后,专家计算可以使用静态形状,减少主机同步和内存碎片,并实现更直接的零拷贝通信。团队还通过激活量化、重新计算、CPU 卸载、跨流水线设备远程卸载等方式,控制 2.8 万亿参数模型的训练内存。

面向百万 Token 智能体强化学习,团队开发了基于 Firecracker microVM 的 AgentENV。该系统支持暂停、恢复、分叉和快照,最低检查点延迟约为 133 毫秒,恢复延迟约为 49 毫秒。报告称,在 K3 的训练和评估过程中,共创建了超过 5100 万个沙箱,涉及约 150 万种环境镜像。

在线推理方面,K3 必须同时管理 KDA 固定状态和 MLA 键值缓存。团队将两类缓存放入统一的分页存储池,并把物理缓存块与前缀哈希粒度分离。即使物理块包含数千 Token,前缀仍可以按 512 Token 边界复用,从而减少长对话和编码任务中重复执行前缀计算的成本。

K3 从监督微调阶段开始对 MoE 专家权重执行 MXFP4 量化感知训练,专家输入激活使用 MXFP8,注意力、共享专家和路由器等模块则保持更高精度。强化学习生成和训练使用相同的量化方式,以减少训练和实际部署之间的精度差异。预训练中的多 Token 预测层还被改造成 EAGLE-3 风格的草稿模型,用于推测解码加速。
👍507🔥3🤡2🖕1
彭博:美国调查在越南的中国工厂,引发新一轮关税担忧

据知情人士透露,美国海关对越南境内有中国关联的工厂开展突击检查,核查单据、原料来源、生产增值量、知识产权侵权问题。虽暂未查获中国货物借越南非法转运的实质证据,但美国可能以此为由加码对越关税。
🤮48🤣25🤡9🍾6😁3💩32👎1🤔1🎉1
LoopDNS资讯播报
25家科技巨头联名签署公开信,力挺开放权重AI模型 包括IBM、Meta Platforms、英伟达、微软在内的25家美国科技公司联名签署公开信,呼吁开放权重AI模型。该公开信指出,开源权重模型对健康的AI生态系统至关重要。美国在人工智能领域面临开放权重的选择。诚然,开放权重模型确实存在真实且独特的风险。但事实上,开放可能是实现AI安全与保障的最重要路径之一。仅仅依赖封闭模型本身并非安全:它们可能被攻破、被滥用,或以外部无法察觉的方式失效。开放权重模型则允许更广泛的研究人员和开发者社区检查其行为、识别漏…
英伟达联合科技巨头成立开源AI安全联盟

英伟达联合微软、SpaceX及Palantir等多家科技企业,发起成立“开放安全人工智能联盟”(Open Secure AI Alliance)。该联盟旨在开发并推广开源AI工具,帮助各界应对网络安全威胁。

针对监管部门及部分行业高管对开源模型安全隐患的担忧,联盟主张将开源AI视为防御性资产而非安全威胁。发起方表示,普及开源技术有助于提升整体网络防御能力,反对针对开源生态采取限制性禁令。

来源:WSJ / NVIDA
🥰23😁9💩83🤮1💯1
LoopDNS资讯播报
与 K2 相比,K3 的层数从 61 层增加到 93 层,总参数量从 1.04 万亿增加到 2.78 万亿,激活参数从 326 亿增加到 1042 亿。路由专家数量由 384 个增加到 896 个,每个 Token 激活的专家数量由 8 个增加到 16 个,共享专家由 1 个增加到 2 个,注意力头则从 64 个增加到 96 个。 K3 的隐藏层维度仍然保持在 7168,没有通过继续扩大模型宽度来完成扩展。它主要增加了网络深度、专家数量和每个 Token 实际调用的专家容量。这意味着“2.8 万亿参数”…
月之暗面开源智能体沙盒系统 AgentENV 破解强化训练安全难题

为解决 AI 智能体在强化训练中尝试“奖励黑客”及突破传统容器隔离边界的工程风险,月之暗面开发并开源了专为智能体打造的自托管沙盒运行时系统 AgentENV。该系统放弃了限制智能体探索能力的做法,改用基于 Firecracker 的轻量级微虚拟机架构,为每个沙盒提供独立内核与硬件级隔离。AgentENV 兼容 E2B API 并支持极速快照与分叉,在保障高自由度训练的同时大幅提升了集群安全性。

来源: Github (Document)
👍72🤮71👏1💯1🖕1
日本防灾科学技术研究所:日本九州发生地震,初步测定震级为7.1级。在日本1至7级震度等级中,熊本县最大震度可能达到7级。

emergency-weather.yahoo.co.jp
😱64🙏54🎉29🐳4🍾4😁3👍2😇2
亚马逊调整AI战略:拟停用大部分旗舰模型并聚焦前沿技术研发

据 Business Insider 报道,亚马逊正在对其人工智能战略进行重大调整,计划逐步停用包括Nova系列在内的大部分现有旗舰AI模型。公司拟将核心资源集中投向由知名学者领导的新一代前沿大模型开发项目,预计首款新模型将于今年年底的年度大会上发布。

此次重组表明亚马逊正在重新调整其AI战略。该公司不再广泛投资于多种文本、图像和视频模型,而是将工程人才和稀缺的计算资源集中投入到最高优先级的项目上。

来源:路透社
👍20🤮5💩4🤔1
LoopDNS资讯播报
中国开始量产国产 DUV 芯片制造工具,本土芯片产业迎来突破 The Information报道称,一家中国国资背景的企业已开始制造 DUV 光刻机。这家总部位于上海的公司整合了来自其他中国企业的浸没式 DUV 研发团队,其中包括国资背景的初创企业上海宇量昇科技有限公司。 这家上海公司计划今年制造约五台DUV光刻机,并在2027年生产约20台。知情人士称,这些DUV系统计划于今年交付给中国本土芯片制造商,包括中芯国际、华虹半导体和存储芯片制造商长鑫存储。 ▎Source
上海本土企业突破浸没式光刻机,ASML市场恐慌情绪或显过度

据路透社报道,上海爱晟纳电子科技集团已开始量产深紫外光刻机(DUV),预计今年产量为5台,2027年提升至20台左右。尽管中国市场占荷兰ASML公司2025年净销售额的29%,该消息引发投资者担忧并导致其市值单日缩水约600亿欧元,但市场分析普遍认为,外界对这一竞争威胁的反应过于悲观。

由于国产设备在性能、可靠性及芯片加工速度上仍与行业龙头存在显著差距,ASML在短期内依然保持着坚固的技术壁垒。此外,ASML正计划于2027年将先进DUV设备的产能提升30%,强劲的全球市场需求将继续为其业绩提供支撑,国产替代引发的实际财务风险在短期内依然可控。


来源:路透社
👍75😁39🤮7🔥5🖕3
美国FCC以国家安全风险为由禁止进口中国人形机器人和联网逆变器

美国联邦通信委员会(FCC)宣布禁止进口来自中国的先进机器人设备(包含人形及四足机器人)以及联网逆变器,称其对国家安全构成“不可接受的风险”。美方官员表示,此类设备收集的数据可能被用于监控或远程操控,相关禁令旨在保障关键与新兴技术的供应链安全,推动美国本土制造业振兴。

本次限制措施适用于尚未上市的新机型,但FCC保留撤销已获批产品销售授权的权力。受影响的逆变器设备系可再生能源与数据中心建设的核心部件,中国目前为该产品在全球的最大生产国。中国驻美大使馆尚未对此做出回应。

来源:The Guardian
🤡74😁19👍11🤮52🤣2🍾2
月之暗面拟获取英伟达Blackwell芯片开发Kimi K4

中国人工智能初创公司月之暗面(Moonshot AI)正在寻求获取更多英伟达 Blackwell 芯片,用于训练其下一代模型 Kimi K4。尽管面临出口限制,该公司此前已使用英伟达芯片成功训练了最近发布的 Kimi K3 模型。

Kimi K3 的推出表明中国企业能够在资源受限的情况下保持技术跟进。月之暗面持续推进芯片采购与模型迭代,进一步引发了外界对中国 AI 加速缩小与国际前沿差距的关注。

来源:The Information
😁77👍28🤮8🤔3🤩3🖕2
韩国KOSPI指数跌幅扩大至11%,SK海力士跌逾17%,三星电子跌超11%。
🤮46👏38😁17🤡4🥰31👍1🤗1🫡1
智库报告关注中国商业航天发展

美国战略与国际研究中心(CSIS)发布报告指出,自2014年开放投资以来,中国商业航天企业已增至约600家。“国网”和“千帆”等项目正在规划万星星座,推进低轨宽带网络建设并拓展国际合作。

报告认为,中国正利用制造优势与政策支持加速构建商业航天生态,发挥军民两用潜力。尽管在重型发射领域仍落后于美国,但其产能扩张与规模化步伐正引发美方对其长期竞争力的关注。

来源:FT
😁53👍10🤮5🐳52🥰2
也门胡塞武装正酝酿对途经曼德海峡(连接红海南部与亚丁湾的关键航道)绝大多数商船征收通行费,中国船舶可免缴。

据路透社消息,7月胡塞高层赴伊朗出席前最高领袖哈梅内伊葬礼期间,伊朗方面与其商议了海峡收费方案。已有伊朗顾问随行赴也门,协助胡塞搭建专门机构管理收费事宜。

来源:外汇交易员
😁76🤡27👍5🖕3🔥2👏2🫡2🤮1
GMF Re­s­e­a­r­ch:昨晚FO­MC最终9票支持、3票反对的维持利率政策不变。符合市场的预期,没有兑现7月加息的判断。从今天美债利率曲线的大幅扭曲变陡看2y和30y的单日扭曲程度创1987年以来历次议息会议最大——市场在一定程度上定价了“政策失误”——今天不加息,未来需要加息更多。
三张同方向反对票在FO­MC历史上比较罕见,上次三张“紧缩反对票”发生在2011年8月和9月两次FO­MC,反对的是维持超低利率的前瞻指引和反对扭曲操作——和今天一样,都发生在“货币政策框架”的变革期,也都来自轮值投票的地方联储主席(而非联储理事)。
沃什明确表示,在就业目标完成(充分就业),当看到底层通胀走高时,会更倾向于收紧政策;当看到底层通胀回落时,会更倾向于放松政策。如果对照FO­MC的声明看(就业达标、通胀仍高且63个月超标、油价反弹),未来紧缩的可能性更高。
沃什多次援引会议间歇期名义和实际收益率的大幅上行,将其视为央行减少前瞻指引、市场替代联储自行紧缩的结果。若这一风格常态化,未来的沃什式紧缩未必通过短端利率上行(加息)实现,而可能通过金融条件收紧(长端利率上行、风险资产下跌)实现。
但这样做的风险在于:若央行迟迟不行动,长端利率的上行未必来自实际利率,而可能来自通胀补偿的走阔——后者等同于市场对联储控通胀能力的不信任投票。
👌28🤮31
翁荔重返OpenAI负责递归自我改进研究

Thinking Machines Lab联合创始人翁荔在因健康原因离职后,已由发言人证实重返OpenAI。此前,她曾在OpenAI担任安全研究副总裁。据悉,翁荔回归后将专注于利用AI模型研发新一代模型,即“递归自我改进”方向的研究。

翁荔的离去使Thinking Machines的联合创始人仅剩米拉·穆拉蒂与约翰·舒尔曼二人。该公司近期发布了开源多模态模型Inkling,并已累计融资20亿美元,估值达100亿美元。

来源:新浪财经
👀20🖕12🤮21👍1
Media is too big
VIEW IN TELEGRAM
【官方双语】压缩即智能:Part1,重新发明熵
本视频从香农与妻子猜字母的经典实验切入,梳理信息论中语言可压缩性的底层原理
Reinventing Entropy | Compression is Intelligence Part 1
https://youtu.be/l6DKRf-fAAM
翻译&时间轴:贰鼠 校正:畏狐之狐
感谢观众的支持: https://3b1b.co/support 一键三联与分享,也是最大的支持!

@3Blue1Brown:
发布视频
35🤮2👍1
中共中央政治局7月30日召开会议,决定今年10月在北京召开二十届五中全会,研究全面从严治党等重大问题。会议由中共中央总书记习近平主持,分析研究当前经济形势并部署下半年经济工作。

会议强调,宏观政策要发力提效,推进“两重”建设和“两新”工作;要扩大内需并深入实施“人工智能+”行动;制定实施全国统一大市场建设条例,整治“内卷式”竞争;同时须稳定房地产市场,深化资本市场投融资综合改革,切实筑牢安全屏障。

来源:澎湃新闻
😁51🤡40🤮13👍4🥱4👻21
韩国交易所检查临时禁止卖空及缩小价格限制的技术可行性

据韩联社,韩国交易所已着手检查“临时禁止卖空”和“缩小价格涨跌幅限制”的执行可能性,将其作为应对股市暴跌的高强度对策之一。此前有消息称,韩国交易所已于29日下午就临时禁止卖空交易的可行性以及系统落地所需时间等进行了内部研讨。

韩联社旗下Infomax援引一位熟悉相关情况的消息人士表示:“目前只确认了技术上可行这一点”,但该人士同时强调:“这只是在为缓解股市波动性而确认可用手段的过程中进行的探讨,并非以实施为前提。”
😁69🤮31👍1🤣1👀1