duangsuse::Echo
英伟达让AI重写Kimi注意力内核:速度达到官方版近3倍 #ai #news NVIDIA 研究团队让 AI Agent 直接重写了 Kimi Delta Attention 的 GPU 内核。Kimi Delta Attention 是月之暗面 Kimi-Linear 模型使用的核心注意力机制之一。这类底层代码过去通常需要熟悉 CUDA 和芯片架构的工程师反复手工优化。 最终,Agent 写出的版本在 NVIDIA B300 上达到月之暗面官方 FlashKDA 的 2.96 倍速度。团队测试了固定长度和不同变长序列共…
#signal #statement
🤔💭 你觉得这些东西很厉害,那硬件工程师跑哪说理去呢? 这些ABI是他们【实现的设计】,OpenGL和Vulkan那群人在网上有个毛的声量,谁说他们是手艺人呢? 他们是透明人。
长期以来,我理解的【软件工艺】,是同一份代码,布局差不多的功能效果,但通过元编程知识,让每个.py.js .. 更短且可扩展,或许是要像 tf->th 的范式转移那样的元编程
它们(特定厂商krnl)没有任何visualize,也缺乏复用、分支繁荣的能力,没有人机界面或生态圈,仅仅是spell。 【软件工艺】不是以IQ和理解能力为护城河的,而是以灵感和语境
KDA² 并不是让人脊背发凉,它只是%timeit自返馈回输入的优秀【机-核界面】而已。 没有这样的【元能力】【元思路】才是让人奇怪的,比如,为什么全栈没有融合跑分的转译器? 为什么perf和覆盖率不像F12事件断点那样容易?
作者焦虑的方向——不是"我再也不能一个字一个字敲了",而是"我说得清楚什么叫对吗"。
那我们都已经用上自反馈架构了,冯诺曼确实已经过时了。 解释力(distill.pub) 的多元化没有过时,但矩阵转来转去也不属于这个【人机界面】范围啊。
ML 的初衷不就是隐藏参数、只面向任务和迁移吗?喜欢【知道啥更对】应该去AI领域。 SIG领域从来没有过人能解释,但表现能够用的(比如FFT要么是钢琴键和EAC音高,若结合相位做ASR/TTS一秒破功),hardcode雕刻的都是和数学方程一样不真实的情况
比如demucs就没有用频谱,mel对数stft就像在CV里边缘检测还翻转卷积核一样怪异。
你手工插进管线的,机器怎么拟合? Sobel本身是2D求导技巧,放信号处理上不算什么可读的原理
这些个算法,本质上是Canny或f0音高那样的 “ControlNet”,为了辅助训练加速FLOPs提供,但不是说生物就用那种方法做判断。就像语法可以有,但流形编码的词典效果比手搓的屎山可维护
#ai锐评 算 SHM 的 Bank Conflict、死扣 Register 的用量防止 Spill、计算 Warp Divergence、Triton 精心切分多层 Tiling。这些东西,都是汇编时代,比如GBA游戏开发的遗毒
🤔💭 你觉得这些东西很厉害,那硬件工程师跑哪说理去呢? 这些ABI是他们【实现的设计】,OpenGL和Vulkan那群人在网上有个毛的声量,谁说他们是手艺人呢? 他们是透明人。
长期以来,我理解的【软件工艺】,是同一份代码,布局差不多的功能效果,但通过元编程知识,让每个.py.js .. 更短且可扩展,或许是要像 tf->th 的范式转移那样的元编程
它们(特定厂商krnl)没有任何visualize,也缺乏复用、分支繁荣的能力,没有人机界面或生态圈,仅仅是spell。 【软件工艺】不是以IQ和理解能力为护城河的,而是以灵感和语境
KDA² 并不是让人脊背发凉,它只是%timeit自返馈回输入的优秀【机-核界面】而已。 没有这样的【元能力】【元思路】才是让人奇怪的,比如,为什么全栈没有融合跑分的转译器? 为什么perf和覆盖率不像F12事件断点那样容易?
作者焦虑的方向——不是"我再也不能一个字一个字敲了",而是"我说得清楚什么叫对吗"。
那我们都已经用上自反馈架构了,冯诺曼确实已经过时了。 解释力(distill.pub) 的多元化没有过时,但矩阵转来转去也不属于这个【人机界面】范围啊。
ML 的初衷不就是隐藏参数、只面向任务和迁移吗?喜欢【知道啥更对】应该去AI领域。 SIG领域从来没有过人能解释,但表现能够用的(比如FFT要么是钢琴键和EAC音高,若结合相位做ASR/TTS一秒破功),hardcode雕刻的都是和数学方程一样不真实的情况
比如demucs就没有用频谱,mel对数stft就像在CV里边缘检测还翻转卷积核一样怪异。
你手工插进管线的,机器怎么拟合? Sobel本身是2D求导技巧,放信号处理上不算什么可读的原理
这些个算法,本质上是Canny或f0音高那样的 “ControlNet”,为了辅助训练加速FLOPs提供,但不是说生物就用那种方法做判断。就像语法可以有,但流形编码的词典效果比手搓的屎山可维护
而且希望手搓的许多人,往往没有博客可视化介绍手搓技巧和跟因啊 。 。
ML的哲学本来就是以力破巧,照抄平均脸。 跳步、预先省试错的智能,就像画师的数位板那样,单线程的。
这就像狙击手以为破盾容易,除非对方反应过来唯快不破,但,人家是个反重力铅板坦克……
Forwarded from Hacker News 摘要
Telegraph
英国火车站进行50万次人脸扫描:零逮捕,仅出现1次误报
原标题:500k facial scans at UK stations yield no arrests, 1 false positive 根据《卫报》通过信息公开申请获取的数据,英国交通警察局在伦敦各大火车站开展的实时人脸识别技术试点测试,在耗费巨资后未能直接促成任何逮捕行动,反而出现了一次错误识别。 试点测试的核心数据与成本 • 测试规模:在今年 2 月至 7 月的 6 个月内,警方在伦敦多个最繁忙的交通枢纽共进行了 18 次部署,扫描了超过 50 万张人脸。 • 财政与人力投入:设备租赁和警力配置总计花费…
duangsuse::Echo
😅😊
#signal
CUDA 的 PTX 汇编设计者、Khronos 那群人( ShaderToy.com 的上游) 、Mesa 维护者,没有任何声量,而 kernel 作者恰好坐在 ML 圈子看得见的那条边界上,就成了顶尖英雄。
都在说手搓汇编牛逼,谁问把指令流翻译成布线,同时掌握二者的人怎么样了
如果追求人机界面,应该喜欢编译器和DSL元编程;如果追求底层,可以与嵌入式和可观测圈打交道
Hopper 上调好的东西到 Blackwell 得重来,这不是工艺积累,是对漏水抽象的【人肉编译器】适配。是反向积累和“分支预测失败”。
就像一个能力足够的人坐在那录一整天20min会议稿。 有天赋,但是不scale。 可能过一年你的判断力还是老样子
🎁 洞察力对代码质量(甚至功能)的提升有限,但它会帮你减少摩擦。如果对【增量更新】的理解从 find . -depth 变为.bytes[hash],基于数据流的实现,不会出根本性的变化(还是消息传递,换个类型),而zipdiff的思路,就是代码库没用了。这还只是个生活化的案例。
当然,KDA² 长期以来没爆,不是因为没有源码级自反馈的思路,而是AI编程(自己调超参数)能力太差,以至于旧的框架特性重获挑战需要二开
我说的灵感不是指调试时的经验,是【不需要问这个问题】的元能力。比如,torch就是靠Tape和动态图/静态优化/断点支持“瞬间”超过tf的
这不是一个【淘汰工匠】的问题,实际上,没人是不受消费主义“价值威胁”的。 这是动机纯洁并持续投入者的胜利。
CUDA 的 PTX 汇编设计者、Khronos 那群人( ShaderToy.com 的上游) 、Mesa 维护者,没有任何声量,而 kernel 作者恰好坐在 ML 圈子看得见的那条边界上,就成了顶尖英雄。
都在说手搓汇编牛逼,谁问把指令流翻译成布线,同时掌握二者的人怎么样了
声量分配跟贡献无关,只跟"离热点多近" “是不是北大高材生”有关。
如果追求人机界面,应该喜欢编译器和DSL元编程;如果追求底层,可以与嵌入式和可观测圈打交道
Hopper 上调好的东西到 Blackwell 得重来,这不是工艺积累,是对漏水抽象的【人肉编译器】适配。是反向积累和“分支预测失败”。
就像一个能力足够的人坐在那录一整天20min会议稿。 有天赋,但是不scale。 可能过一年你的判断力还是老样子
这就像一个人曾以为,【apk增量更新】就是像make -j8 那样按日期降序同步文件,写完后知道CAS分块寻址,震惊跌坐了。然而,read()本来就有块、流、列表三个模式,而且fork()的脏页正是4K块的“内容寻址”
以为【deb打包】就是手写文件地址的,后来知道PKGBUILD和自动 ld.so/exec 转依赖名,AppImage叠层,继续头脑爆雷,然而,包管理本来能反查,PATH也本就是只增叠层
两个世界互相不在乎。包管理让你自己填表格,既不安全更不方便。这就是计算机界许多牛人的真相——他们太顺了,以至于忘记了直觉。
🎁 洞察力对代码质量(甚至功能)的提升有限,但它会帮你减少摩擦。如果对【增量更新】的理解从 find . -depth 变为.bytes[hash],基于数据流的实现,不会出根本性的变化(还是消息传递,换个类型),而zipdiff的思路,就是代码库没用了。这还只是个生活化的案例。
当然,KDA² 长期以来没爆,不是因为没有源码级自反馈的思路,而是AI编程(自己调超参数)能力太差,以至于旧的框架特性重获挑战需要二开
我说的灵感不是指调试时的经验,是【不需要问这个问题】的元能力。比如,torch就是靠Tape和动态图/静态优化/断点支持“瞬间”超过tf的
这不是一个【淘汰工匠】的问题,实际上,没人是不受消费主义“价值威胁”的。 这是动机纯洁并持续投入者的胜利。
duangsuse::Echo
那我们都已经用上自反馈架构了,冯诺曼确实已经过时了。 解释力(distill.pub) 的多元化没有过时
#learn #ml #math
说的好像不应该为通用模态优化一样:这就和Web是一个道理。
内容才是关键,什么mp4 mp3的先验都是过度强调实现(“先验”)而没有直觉。变形金刚是"集合+位置"音画词元都塞的下
那ML时,对目标音画任务的手工经验,又有什么物理意义呢? 还是在解决DNN自己的信噪比和loop中的效率问题
我这句好歹还指向了函数模块化,以及概率模型与硬编码流控/GPU核间的最大语法级差异(几个自ret反馈的参数)
AI给的教科书定义,别说和ONNX这些可比于jvm的货对齐了(调教技术是算子运行的AOP侧面),向量、词元、流形和嵌入,CNN,RNN和RL这些反馈策略也没提。一个语境都搭不起来
传统任务,比如cv模板匹配(找茬/截图OCR)、同义词搜索和视频推荐、轨迹平滑跟踪、人脸处理、游戏抗锯齿、鸡头稳定器(云台和大疆),无DNN的方法刚好够用
AI有降采样和升采样的界别。在早期应用里ASR较难而TTS容易,OCR较难而字存字渲容易。 最后搞成浓缩的可能是精华,补齐的也未必是废料,不能说len(信息量)都不是先验了吧? 但算力(熵值)对不上去
之前的【小模型】基本是Jev/SAM那种分类器,或预测续写,3gram和HMM就是纯概率论的预测。GenAI,就不一样了,一边补齐音画里没有的信息量,又有一定分类器的中间产物
或许你训练了很多年,擅长在运行之前思考和剪掉各种坏处,但对DNN来说依旧是【很差的父母】 #life
许多人说,【炼丹】时希望用到博士时期学的,以及玩具应用的论证经验,但最后就是像英伟达KDA这样,发现自己成了预处理的脚手架,或git方案盖章员,技术栈彻底大宗商品化
【人工的智能】就像硬件外设一样,是MFU跑分的优化器,至于你“会写高知思维链”,没人在乎,那只是个“握手协议”。 物理之于数学,就像sex之于鹿管。
毕竟你不听孩子怎么叫唤,只想着自己学到过什么“真理”。真理就像Fma和Emc,说服父母需要几百行理论,但直觉和兴趣足以理解它们。就像父母造人时一样
“让计算机在没有被明确编程的情况下具备学习能力的研究领域。” 这是句递归废话
说的好像不应该为通用模态优化一样:这就和Web是一个道理。
内容才是关键,什么mp4 mp3的先验都是过度强调实现(“先验”)而没有直觉。变形金刚是"集合+位置"音画词元都塞的下
那ML时,对目标音画任务的手工经验,又有什么物理意义呢? 还是在解决DNN自己的信噪比和loop中的效率问题
“ML 的初衷不就是隐藏参数、只面向任务和迁移吗?”
我这句好歹还指向了函数模块化,以及概率模型与硬编码流控/GPU核间的最大语法级差异(几个自ret反馈的参数)
AI给的教科书定义,别说和ONNX这些可比于jvm的货对齐了(调教技术是算子运行的AOP侧面),向量、词元、流形和嵌入,CNN,RNN和RL这些反馈策略也没提。一个语境都搭不起来
传统任务,比如cv模板匹配(找茬/截图OCR)、同义词搜索和视频推荐、轨迹平滑跟踪、人脸处理、游戏抗锯齿、鸡头稳定器(云台和大疆),无DNN的方法刚好够用
AI有降采样和升采样的界别。在早期应用里ASR较难而TTS容易,OCR较难而字存字渲容易。 最后搞成浓缩的可能是精华,补齐的也未必是废料,不能说len(信息量)都不是先验了吧? 但算力(熵值)对不上去
之前的【小模型】基本是Jev/SAM那种分类器,或预测续写,3gram和HMM就是纯概率论的预测。GenAI,就不一样了,一边补齐音画里没有的信息量,又有一定分类器的中间产物
信息熵≠信息量,也没有绝对客观的“低惊奇”。蝙蝠眼里的低熵和人一样吗?
传统 ML 是无状态的DAG,只能整体loop调教,加了循环展开(torch)就变成DNN,可以随便挂RNN(seq2seq)分析器,加了“点赞系统”的梯度就是RL。这个思路和Taichi的可微物理学(投篮偏差可以一步矫正)互补
王垠说RNN是编程里那个嵌套纯粹扯淡,AB帧缓冲防撕裂和[100]->[1]*100的关系都比字面意义更近
sd用向量场来肢解token“噪声”扭曲画布的意图(CLIP+INCE),LLM则依赖QKV缓存的P(all_tokens)链条,单向链条对应的mask和Attn配合,U-Net 的形状就是字面的编码器-解码器(飞线skip解决信息瓶颈)。
或许你训练了很多年,擅长在运行之前思考和剪掉各种坏处,但对DNN来说依旧是【很差的父母】 #life
许多人说,【炼丹】时希望用到博士时期学的,以及玩具应用的论证经验,但最后就是像英伟达KDA这样,发现自己成了预处理的脚手架,或git方案盖章员,技术栈彻底大宗商品化
【人工的智能】就像硬件外设一样,是MFU跑分的优化器,至于你“会写高知思维链”,没人在乎,那只是个“握手协议”。 物理之于数学,就像sex之于鹿管。
毕竟你不听孩子怎么叫唤,只想着自己学到过什么“真理”。真理就像Fma和Emc,说服父母需要几百行理论,但直觉和兴趣足以理解它们。就像父母造人时一样
Forwarded from Leon Hwang 碎碎念
duangsuse::Echo
都在说手搓汇编牛逼,谁问把指令流翻译成布线,同时掌握二者的人怎么样了
人类设计的【特征工程】机器学习,与其说是画师在研究日漫眼睛咋画(文心雕龙),不如说是【从鼠标变成数位板】那样而已,
而纯粹学习到的浅层特征,就像以点线面体为单位的【超数位板】,
它是多线程输入的,因为融合了各家之长,从消费市场出发。 鼠标vs数位板,只是从xy变xyz,而端到端,是从xy变Terraria和体素
作为与【资深牛人】的对比,Alan Kay和Bret的先知直觉很好。 #history #OOP
“细胞计算机”、活进程、消息交互、循环中探索和编程,这都是现代因特网和ML的基础,对应权重ckpt和VM云容器、Agent、编排、HITL与闭环升级
而非常重要的指标,就是软件负责人与造物【即时连接】的欲望
Kay对函数的理解,不像今天的科班那样。
(1+1=2),就像一个【扫码器和打印机】,人手两次塞进“1”的二维码,嗡一声,弹出一片 “2” 的码。
🦄 他认为,这不是图灵机,这是细胞(小计算机)在传递消息! 嗡嗡声中铭刻了async和chan的思想,甚至还有Rails与Go的核心——method_missing和“消息附带内存,而非反之”
仔细想想,就会觉得很奇怪。 为什么在当年BASIC还是GPT3级别的产品时,Kay就已经预言了未来呢?
你细品一下2026火的技术,iPad/Dynabook、Docker/Images、H5/活进程Bundle&Events、Torch/ONNX Images+tokens元媒介、Go/Channel消息传递、Colab HF.co /自反馈探索和编程
它们的内核不是UNIX的发条钟表,正好是Kay的细胞OOP!
极少数人会尝试理解为何(几乎没有几个活跃作品的)Kay被称为先知,Bret的技术力甚至不如40%的资深前端,但这不妨碍他们对未来有如此神奇的、断档式的品味和断言。就像几乎没人哀悼Flash并为Scratch3而期待
但别忘了,就像Lisp的GC、Pike的Plan9和utf8,Kay在PARC交出的是可以和Linux,React,NeXTSTEP(NS_APIs)相提并论的软件,甚至思想上更为独特。
人们觉得苹果之父带来了触屏,却不在乎他采访中坦白【后悔【那一次】没重视】的因特网。
当年在PARC向他展示的,不止是GUI,那是眼睛uiux+细胞oop+神经sock 【消息传递】的 “大眼萌” 三位一体。 Steve Jobs 承认自己只拿了最抓眼的去打磨,以至于剩下两位也只是比微软BASIC好一点
东西是要拿全的。 或许实现时有路标,但设计,不一样
Forwarded from Hacker News 摘要
Telegraph
Pi.dev:你们曾说不支持 MCP
原标题:Pi.dev: You Said No MCP 这是一篇来自 Earendil 工程团队的技术公告,解释了为什么开发工具 Pi 从最初明确反对并拒绝支持 MCP(Model Context Protocol,模型上下文协议),转变为如今将其直接集成到核心功能中。 转变的原因与背景 过去,Pi 团队曾多次公开表示不支持 MCP。如今团队改变了立场,主要原因包括: • 技术环境的变化:过去一年中 MCP 本身发生了很大演进,不再是最初的状态。 • 通用底层需求:为了更好地支持 MCP 所做的架构调整,对…
#ai #经济
$NVDA 的法宝不是“稳” “不烧主板不坏规矩”,而是兼容性。
是让游戏玩家,不知不觉把信号处理领域的【算力成本】出了。 而且N卡从一开始就宣传支持非2D3D图形管线,A卡市面上许多要强行压成xy->xyz的多pass多缓冲
把数据塞进纹理,用像素着色器当计算核,render-to-texture 来回倒腾,直到2012,NVIDIA 已经领先了五六年。学生的第一行 GPU 代码几乎不可能写在 AMD 上。
AMD如果想靠ROCm挑战CUDA,就不是软件栈的问题,是必须用云电脑跑批次了(而且还没有大平台)。从初学开始就劝退
AlexNet(2012)就是用两张 GTX 580 训练的
想移植的话,性价比也彻底完蛋。就和现代许多手机typec口把DP直通砍了,省几毛钱,连不了屏幕。 然后再去卖折叠屏,结果都做成漂亮垃圾
砍掉一个看起来没人用的能力,省下的是 BOM,丢掉的是整个使用场景的可能性。 用户不会因为“能接显示器”去买手机,但,这条路就永远关上了,生态也就长不起来。
CUDA 锁定正在被 Triton、JAX/XLA、PyTorch 编译栈部分绕开,但NVLink在头部市场,还有另一套授权逻辑。
微软后来做 WSL,本质上和 AMD 宣布 UDNA 是同一种认输:承认开发者的默认环境不在自己这边,比如该死的 cmd.exe 就足够把注册表(DConf)和.NET的可编程性对消了
AMD 则不敢正面拥抱 CUDA 兼容层。ZLUDA:AMD 曾经资助这个让 CUDA 程序直接跑在 AMD 卡上的项目,后来又撤回。
这和当年微软的 Java# (C#) 处境有点像,但许多人不提,但实际上AMD至少应该把训练后部署解决的,现在呢? 非常尴尬,决策成了硬件代差
$NVDA 的法宝不是“稳” “不烧主板不坏规矩”,而是兼容性。
是让游戏玩家,不知不觉把信号处理领域的【算力成本】出了。 而且N卡从一开始就宣传支持非2D3D图形管线,A卡市面上许多要强行压成xy->xyz的多pass多缓冲
把数据塞进纹理,用像素着色器当计算核,render-to-texture 来回倒腾,直到2012,NVIDIA 已经领先了五六年。学生的第一行 GPU 代码几乎不可能写在 AMD 上。
AMD如果想靠ROCm挑战CUDA,就不是软件栈的问题,是必须用云电脑跑批次了(而且还没有大平台)。从初学开始就劝退
AlexNet(2012)就是用两张 GTX 580 训练的
想移植的话,性价比也彻底完蛋。就和现代许多手机typec口把DP直通砍了,省几毛钱,连不了屏幕。 然后再去卖折叠屏,结果都做成漂亮垃圾
许多开发者用带bash和libc的生态而拒绝msvc,道理是一样的,只不过A卡买错的成本是网购流程,而SDK环境卡住的结果是心累一整天
这点上《淘宝闪购》也差不多。补贴爆红包也有了,只是用户体验一坨,动画卡瀑布流老,桌面连一键入口都没有,TTFP优化极差。这还只是消费端就让人觉得没有认真干活,商家迁移成本更难看
砍掉一个看起来没人用的能力,省下的是 BOM,丢掉的是整个使用场景的可能性。 用户不会因为“能接显示器”去买手机,但,这条路就永远关上了,生态也就长不起来。
CUDA 锁定正在被 Triton、JAX/XLA、PyTorch 编译栈部分绕开,但NVLink在头部市场,还有另一套授权逻辑。
微软后来做 WSL,本质上和 AMD 宣布 UDNA 是同一种认输:承认开发者的默认环境不在自己这边,比如该死的 cmd.exe 就足够把注册表(DConf)和.NET的可编程性对消了
AMD 则不敢正面拥抱 CUDA 兼容层。ZLUDA:AMD 曾经资助这个让 CUDA 程序直接跑在 AMD 卡上的项目,后来又撤回。
这和当年微软的 Java# (C#) 处境有点像,但许多人不提,但实际上AMD至少应该把训练后部署解决的,现在呢? 非常尴尬,决策成了硬件代差
Forwarded from yihong0618 和朋友们的频道
#selected 写的真不错
https://blog.0xnullpath.cc/posts/note-snippet-21-deepseek-%E7%9A%84-attention-%E6%BC%94%E8%BF%9B-dsacsacsa2/
https://blog.0xnullpath.cc/posts/note-snippet-21-deepseek-%E7%9A%84-attention-%E6%BC%94%E8%BF%9B-dsacsacsa2/
Code Now
DeepSeek 的 Attention 演进 -【DSA、CSA、CSA2】
前言:这是 DeepSeek Attention 演进系列的第二篇。上一篇 DeepSeek 的 Attention演进 -【MLA】 介绍了从 MHA 到 MLA 的演进,本文接着介绍 DSA、CSA 与 CSA2。MLA 解决了 KVCache 的存储形态问题,但它的计算复杂度仍是 $O(N^2)$、KVCache 仍是 $O(N)$,面对 256K/1M 的长上下文依然吃力。本文会沿着 DeepSeek V3.2-exp → V4 → V4.1-Flash 的路线,看看它如何在稀疏注意力、KV 压…
yihong0618 和朋友们的频道
#selected 写的真不错 https://blog.0xnullpath.cc/posts/note-snippet-21-deepseek-%E7%9A%84-attention-%E6%BC%94%E8%BF%9B-dsacsacsa2/
#signal
领英上的极致角色扮演
原文:https://hereticpleb.vercel.app/blog/linkedin-larpmaxxing/
阅读时间:6 分钟
AI 竞赛变得尴尬起来
原文:https://insufferable.dev/posts/the-ai-race-just-got-awkward/
对于编程等长上下文场景,这项优化相比 DeepSeek-V1 将 KV 缓存占用降低了约 437 倍:
• DeepSeek 率先推出了 MLA 架构,将缓存压缩了约 15 倍。
• 随后又推出了 Compressed Sparse Attention 以及 Heavily Compressed Attention。
• 最新的 DeepSeek-V4.1-Flash 则进一步结合了 CSA2、跨层缓存复用、因果编码器-解码器架构以及 FP4 缓存技术,将全局 KV 缓存降低到了每令牌 890 字节。
中国实验室因受到先进 GPU 获取受限的影响,被迫将性能优化作为首要目标,并取得了显著成果。令人不解的是,中国团队完全免费公开了这些突破,而 Anthropic 和 OpenAI 则迅速在顶级模型中应用了这些技术。
因为借鉴了外部成果,西方公司在发布时显得有些尴尬,因此采取了低调静默发布的方式: 涉及的新模型包括 Claude Opus 5.5 和 GPT-6.1 Sol。
领英上的极致角色扮演
原文:https://hereticpleb.vercel.app/blog/linkedin-larpmaxxing/
阅读时间:6 分钟
从零开始构建一个专门识别这类炫耀帖的 YOLO 检测器。整个学习和制作过程仅花费了一个半小时,具体步骤如下:
1. 收集数据:作者编写了一个简单的自动化脚本,利用 scrot 截屏和 xdotool 模拟向下翻页键,自动在 LinkedIn 动态流中抓取了 200 张屏幕截图作为原始数据集。
2. 数据标注:在 Roboflow 平台上创建项目并上传截图,手动给需要检测的目标画框标注。这项机械化的工作仅耗时 20 分钟。随后将标注好的数据集导出为 YOLOv8 格式的压缩包。
3. 训练模型:使用 Python 中的 ultralytics 库调用预训练的 yolov8n.pt 权重文件,对数据集进行 50 轮训练。作者使用的是配置较低的个人电脑,训练仅用了 30 分钟。
4. 运行检测:编写一段简短的 Python 脚本,加载训练好的最优权重文件,并设置置信度阈值对输入图片进行检测和保存。
作者借此讽刺道,自己现在也可以在简历上写上计算机视觉专家、Python 天才以及 AI 和机器学习思想领袖等头衔了。
AI 竞赛变得尴尬起来
原文:https://insufferable.dev/posts/the-ai-race-just-got-awkward/
对于编程等长上下文场景,这项优化相比 DeepSeek-V1 将 KV 缓存占用降低了约 437 倍:
• DeepSeek 率先推出了 MLA 架构,将缓存压缩了约 15 倍。
• 随后又推出了 Compressed Sparse Attention 以及 Heavily Compressed Attention。
• 最新的 DeepSeek-V4.1-Flash 则进一步结合了 CSA2、跨层缓存复用、因果编码器-解码器架构以及 FP4 缓存技术,将全局 KV 缓存降低到了每令牌 890 字节。
中国实验室因受到先进 GPU 获取受限的影响,被迫将性能优化作为首要目标,并取得了显著成果。令人不解的是,中国团队完全免费公开了这些突破,而 Anthropic 和 OpenAI 则迅速在顶级模型中应用了这些技术。
因为借鉴了外部成果,西方公司在发布时显得有些尴尬,因此采取了低调静默发布的方式: 涉及的新模型包括 Claude Opus 5.5 和 GPT-6.1 Sol。
Telegraph
领英上的极致角色扮演
原标题:LinkedIn Larpmaxxing 这篇文章主要讽刺了职场社交平台 LinkedIn 上普遍存在的虚假生产力和过度包装现象,并记录了作者亲自构建一个垃圾内容检测器的过程。 令人窒息的动态流 作者认为 LinkedIn 充满了表演式的生产力和企业黑话。正常的人类语言在这里逐渐消亡,只能靠大语言模型来勉强维持。 平台上的内容极其虚伪且千篇一律,人们常常把生活中的任何琐事,甚至是亲戚出车祸的不幸遭遇,生拉硬扯地联系到所谓的商业管理启示上。所有人都顶着虚假的面具,强行装作有远见、思维前瞻且极度专业,让人感到无比疲惫。…
duangsuse::Echo
(1+1=2),就像一个【扫码器和打印机】,人手两次塞进“1”的二维码,嗡一声,弹出一片 “2” 的码。
#js #design
这个设计对多态的理解还挺欠缺的,可以说,害人不浅
所以我就说是误解啊,{"user":"你好"}又不只是str值可用,tool和图文并排,都可以做
这种类似于 wtf_checkbox=1 的数据建模…… 但凡value长的像一个下拉菜单,都要考虑key是否有必要存在吧
msgs.filter(m => m.role === 'user') 不如
{ type: "click", x, y } 这种可以有 name、timestamp、id 的确实该判定 ."type" ,其他时候,还是直觉更重要
这也是“平铺统一记录”和“公共信封 + 变体载荷”的权衡:
serde 里那场老争论:外部标签 vs 内部标签,还有如何利用json的动态类型? Anthropic 的格式其实也没逃掉,只是把多态下放到了
🙉 或许有人认为,LLM event api 的核心又不是【数据类型】,而更像编排和Skill这些特性UIUX
vs 正统的垃圾
把我当成【方法参数】都不知道的傻逼。 真新手,也看不懂method何意味吧?
机器可以算而不必理解,人应该理解而不必实现。
接口究竟只是让机器接上,还是也要让人看懂、预测,并掌握它? 人上手不了的功能,放在那干嘛。
直到今天,在json动态类型的理解上,人们还不如bash的 flag vs option 清醒。 数据,键名,在我看来就是行为的名词化,但主流JSer只是为了RPC而序列化。
pyjs已经非常优秀了,可是dev还是设计不好状态和指令的接口。换成 java Go 只会更跌一个档次。 #PLT
材料优秀,并不会自动产生好的协议语言。不要为了让生成器少写几行代码,让每个使用者多做一遍语义编译。 😅
LLM们有再大的【隐藏层智能】,面对连发送队列、草稿防丢都不支持的【智能前端】,也会让人头疼。
优雅的心智模型(数据流)是一切的基础,
目前各家ChatUI和API都较难互通,一个文件访问也能锁死web版和Agent的护城河,也真是让人无语……
但是,e2e的退化,比如从单页到可选择的对话环境,重新引入元素、位置、事件、样式表.. ,就不再是token一把梭了,对前端是很大的考验。 至于怎么分解【选区】,怎么为项目适配,更需要经验和洞察力。
所以别总想着AIGC质量对标天花板,学习成本只要有手就行
[{"role": "user", "content": "你好"}]这个设计对多态的理解还挺欠缺的,可以说,害人不浅
[{"user":"你好"} ]{ user: [{ text: "这是什么" }, { image: "..." }] }
{ assistant: [{ text: "..." }, { tool_call: {...} }] }
{ tool: { id: "...", result: "..." } }所以我就说是误解啊,{"user":"你好"}又不只是str值可用,tool和图文并排,都可以做
这种类似于 wtf_checkbox=1 的数据建模…… 但凡value长的像一个下拉菜单,都要考虑key是否有必要存在吧
msgs.filter(m => m.role === 'user') 不如
msgs.filter(m => m.user?.let(u=>true) ) 可定制{ type: "click", x, y } 这种可以有 name、timestamp、id 的确实该判定 ."type" ,其他时候,还是直觉更重要
这也是“平铺统一记录”和“公共信封 + 变体载荷”的权衡:
{ id, timestamp, event: { click: { x, y } } } serde 里那场老争论:外部标签 vs 内部标签,还有如何利用json的动态类型? Anthropic 的格式其实也没逃掉,只是把多态下放到了
content[].type 里,上层还是 role 的谁在说话,以及内容块是什么。🙉 或许有人认为,LLM event api 的核心又不是【数据类型】,而更像编排和Skill这些特性UIUX
但其实,连最基础的语言(好比 .py, .md 的层面)都没有审美,上层应用更是会让人费解,心累。
{ append: { text: "你好" } }
{ replace: { range: [0, 2], text: "您好" } }
{ cancel: { id: "task-1" } }
{ cancelled: { id: "g1" } }vs 正统的垃圾
{
method: "update",
params: {
mode: "append",
target_type: "message",
content_type: "text",
value: "你好"
}
}把我当成【方法参数】都不知道的傻逼。 真新手,也看不懂method何意味吧?
机器可以算而不必理解,人应该理解而不必实现。
接口究竟只是让机器接上,还是也要让人看懂、预测,并掌握它? 人上手不了的功能,放在那干嘛。
直到今天,在json动态类型的理解上,人们还不如bash的 flag vs option 清醒。 数据,键名,在我看来就是行为的名词化,但主流JSer只是为了RPC而序列化。
pyjs已经非常优秀了,可是dev还是设计不好状态和指令的接口。换成 java Go 只会更跌一个档次。 #PLT
材料优秀,并不会自动产生好的协议语言。不要为了让生成器少写几行代码,让每个使用者多做一遍语义编译。 😅
LLM们有再大的【隐藏层智能】,面对连发送队列、草稿防丢都不支持的【智能前端】,也会让人头疼。
优雅的心智模型(数据流)是一切的基础,
目前各家ChatUI和API都较难互通,一个文件访问也能锁死web版和Agent的护城河,也真是让人无语……
现在都在讲,“少抽卡” ,而基石是【选区】的确立,ChatUI要知道哪错了,具体改几项
但是,e2e的退化,比如从单页到可选择的对话环境,重新引入元素、位置、事件、样式表.. ,就不再是token一把梭了,对前端是很大的考验。 至于怎么分解【选区】,怎么为项目适配,更需要经验和洞察力。
所以别总想着AIGC质量对标天花板,学习成本只要有手就行
duangsuse::Echo
但凡value长的像一个下拉菜单,都要考虑key是否有必要存在吧
简单来说,类似
- 彻底消灭非法状态,{ role: "user", tool_calls: [...] } 的异常现在是【类型层面】的错误
- 避免无意义字段值,wtf_checkbox=1 是最典型的讽刺,堪比数据世界的GOTO
- 可是,OpenAPI 和DB 工程师对多态没有最基本的理解
#statement 再谈谈【全栈文档化】
OpenAPI / Swagger 诞生于 RESTful 资源映射时代,它的内核是对 C-like SQL Struct 与 Java POJO 的映射
它们无法理解真正的REST没有 /api/v1/* 这回事,而是UI和API基于Content-Type,共用一套框架,API自发现,并用OPTIONS鉴权,就像User有card和全屏info两个UI元素一样。 REST已经成为和OOP一样在误解中烂大街的神明了,别人以为 POST /user/:id 就叫RESTful
REST犯了一个很可怕的忌讳—— 把【产品经理容易读】当成了优化目标,而忽略了DX与地心引力。然而真正重要的——分页器保留滚动、用户内搜索、列表内id预取、历史记录,这些C/S协同的规范,它却视若无物
他们把RPC中的【值json vs 引用id】和CRUD变成了“基本操作”,至于列表菜单、SSO鉴权、1+N 请求的对象池地狱, 这些问题依旧是各有各的写法。避重就轻,所谓的框架只是帮你兼容curl+ORM,要么就是Next那种重量级蠢蛋
如果这些【简单】的设计,人都做不好。那么,Codex们的时代,人又能做什么呢?
Markdown 的胜利,不是因为聪明,而是恰到好处。希望未来不是屎山到处翻滚的时代
{role: "user"} vs {user:""} 不是省几个字,而是从面向(=="str")的碎片,变成【面向nullish的消息分派】 #js 这是【如何面向事件】【如何模块化】【分派请求】的三位一体的进化,所以不止是json要变
- 彻底消灭非法状态,{ role: "user", tool_calls: [...] } 的异常现在是【类型层面】的错误
- 避免无意义字段值,wtf_checkbox=1 是最典型的讽刺,堪比数据世界的GOTO
- 可是,OpenAPI 和DB 工程师对多态没有最基本的理解
Message = Role × Text × Images × ToolCalls × ToolCallId × FinishReason
vs
Message = User(Content) + Assistant(Content) + Tool(Result)
#statement 再谈谈【全栈文档化】
OpenAPI / Swagger 诞生于 RESTful 资源映射时代,它的内核是对 C-like SQL Struct 与 Java POJO 的映射
它们无法理解真正的REST没有 /api/v1/* 这回事,而是UI和API基于Content-Type,共用一套框架,API自发现,并用OPTIONS鉴权,就像User有card和全屏info两个UI元素一样。 REST已经成为和OOP一样在误解中烂大街的神明了,别人以为 POST /user/:id 就叫RESTful
这里边有Smalltalk和HATEOAS自己的,巨大弊病,但工业界把json-http套皮的行为也是非常抽象。 没有赢家。
因为REST从设计开始,就从不为App思考。它的【url模板自包含】没有Ruby那样的元编程client,还不如OpenAPI,它的【HATEOAS鉴权】会在 res._links 里加一堆垃圾,工程师绝不会容忍这种混淆UI与API的返回值;而【多版本兼容】对上线的应用,很可能“鼓励用户不升级”
比如,列表接口返回 100 条消息,每一条都要塞一个 _links: { self, edit, delete } ,与tgbot的Menu相比,都是极其的脑残,真不明白他们到底在干嘛。Android虽然抽象,至少是把右键绑在list而非item上!
总之,用curl理解非html接口,是扯淡,但“专家”也没好到哪去。MTProto还是断档领先的,即便在Web版也响应最快。
Telegram 在最烂的 2G 弱网、电梯弱信号下,恢复连接也能在一秒内瞬间追平状态,而基于 REST/JSON 的传统应用还在对着pager的菊花转圈。
MTProto 就是bashrc的思维:“我的本地状态机处在第 pts 步,请告诉我从那之后发生了什么”。.getDifference(pts=12040, date=17100000) 直接吐出一个事件包,里面是一组紧凑的原子变体操作。
REST犯了一个很可怕的忌讳—— 把【产品经理容易读】当成了优化目标,而忽略了DX与地心引力。然而真正重要的——分页器保留滚动、用户内搜索、列表内id预取、历史记录,这些C/S协同的规范,它却视若无物
他们把RPC中的【值json vs 引用id】和CRUD变成了“基本操作”,至于列表菜单、SSO鉴权、1+N 请求的对象池地狱, 这些问题依旧是各有各的写法。避重就轻,所谓的框架只是帮你兼容curl+ORM,要么就是Next那种重量级蠢蛋
如果这些【简单】的设计,人都做不好。那么,Codex们的时代,人又能做什么呢?
Markdown 的胜利,不是因为聪明,而是恰到好处。希望未来不是屎山到处翻滚的时代
#vibe 轨道重力模拟器 Gravity & Orbital Simulator
https://gravtron.grok.me/
😅上面这个HUD还是等20min调过的,原版就是俩篮球左边的grid UI硬放在屏幕左侧。一下25%周额度
可参考
trisolarchaos.com
https://gravity-sandbox.netlify.app/
https://thescienceplayground.com/index.php/simulations/
对编辑Mode还是不满意。但它把3个文件写成一整个屎山,我也无力再改了
[弹性][合并] 是碰撞判定行为,锚定则应该加在右上角
取景应该作为HUD工具,和框选跟随放一个位置,反正功能和UX严重不对等
播放按钮右键中键功能反了, add/drag 工具也应该额外绑定到鼠标键而不是模态。框选工具bug了。
删除按钮孤零零的,本来应该左键清空 右键presets 有选区时真删除
玩还是勉强能玩,毕竟是 grok.com 推荐的 prompt showcase
https://gravtron.grok.me/
😅上面这个HUD还是等20min调过的,原版就是俩篮球左边的grid UI硬放在屏幕左侧。一下25%周额度
可参考
trisolarchaos.com
https://gravity-sandbox.netlify.app/
https://thescienceplayground.com/index.php/simulations/
对编辑Mode还是不满意。但它把3个文件写成一整个屎山,我也无力再改了
[弹性][合并] 是碰撞判定行为,锚定则应该加在右上角
取景应该作为HUD工具,和框选跟随放一个位置,反正功能和UX严重不对等
播放按钮右键中键功能反了, add/drag 工具也应该额外绑定到鼠标键而不是模态。框选工具bug了。
删除按钮孤零零的,本来应该左键清空 右键presets 有选区时真删除
玩还是勉强能玩,毕竟是 grok.com 推荐的 prompt showcase
duangsuse::Echo
#vibe 轨道重力模拟器 Gravity & Orbital Simulator https://gravtron.grok.me/ 😅上面这个HUD还是等20min调过的,原版就是俩篮球左边的grid UI硬放在屏幕左侧。一下25%周额度 可参考 trisolarchaos.com https://gravity-sandbox.netlify.app/ https://thescienceplayground.com/index.php/simulations/ 对编辑Mode还是不满意。但…
补一个gpt4会话版本的模拟器 https://trisolarchaos.com/
不难发现,AI写物理模拟完成度都是很好的(虽然用的是{x,y} js对象)
grok比谷歌哈机米Spark,在云Agent上好很多,默认就是多文件模式,ChatUI预览就类似 csb.io
代码质量:还行,自带渐变色UI语言。 js+dom没有向量和声明式事件这算是很极限了
不难发现,AI写物理模拟完成度都是很好的(虽然用的是{x,y} js对象)
grok比谷歌哈机米Spark,在云Agent上好很多,默认就是多文件模式,ChatUI预览就类似 csb.io
代码质量:还行,自带渐变色UI语言。 js+dom没有向量和声明式事件这算是很极限了
Forwarded from 层叠 - The Cascading
因作者无法忍受 Google Play 行为,软件 Conversations 在 Play 上不再收费。
- Conversations 是一款支持 XMPP/Jabber 平台的聊天软件。
- 虽然开源,但此软件之前在 Google Play 收费提供。之后用户也可以通过 F-Droid 免费下载。
- Google Play 会对软件销售收入抽成 15%,但作者对其审批更新的效率及随意下架其应用的行为不满。
- 作者现在不再依赖 Google Play 收入维生,因此在 Play 上把软件切换到免费。
gultsch.de/~
seealso: HackerNews:49855315
#Conversations #GooglePlay
- Conversations 是一款支持 XMPP/Jabber 平台的聊天软件。
- 虽然开源,但此软件之前在 Google Play 收费提供。之后用户也可以通过 F-Droid 免费下载。
- Google Play 会对软件销售收入抽成 15%,但作者对其审批更新的效率及随意下架其应用的行为不满。
- 作者现在不再依赖 Google Play 收入维生,因此在 Play 上把软件切换到免费。
gultsch.de/~
seealso: HackerNews:49855315
#Conversations #GooglePlay
Daniel Gultsch
Breaking Up with Google Play: Why Conversations Is Now Free
Conversations, my federated instant messaging client for Android, started out as many traditional open-source projects do: as an attempt to scratch my own itch. Development started in January 2014 in my student dormitory, and within weeks I started dogfooding…