※ 引述《ryhma (k歌之王)》之铭言:
: 哈囉 你各位杂质
: 是我小伟辣
: 中国狗的深度求索(DeepSeek)人工智能还在R1
: 号称五百万美金训练出来的模型
: 打趴欧美各国人工智能模型
: 好久更新模型惹
: 怎么办罗福莉会不会被抓去劳改
: 八卦版中国狗赶快来嘘我
: 蓝白狗赶快来嘘
: 西西
元旦Deepseek发表的论文公布名为“流形约束超连接”(Manifold-Constrained Hyper-Connections)的新框架
这项技术透过优化神经网络架构,在仅增加 6.7% 训练时间的情况下大幅提升训练稳定性,这在大型模型训练中被视为非常低且可接受的代价。
这技术可以把大模型做宽,以前的垃圾卡H20都可以拿来训练新的模型
https://youtu.be/1s3dvNr8JzE
Closed AI及Google都不敢挑战的做宽大模型,Deepseek搞定了
近期即将发布的V4模型大概又要屠榜兼价格屠夫了
原理请看下面的新闻内文
该篇论文彻底终结由 AI 教父何恺明团队于 2016 年提出的旧时代霸主:ResNet(深度残差网络)架构
mHC 的核心逻辑,就是替多通道架构加上严格的“流形约束”,犹如为网络讯号聘请了一位精通高深数学的“AI 交通警察”。
DeepSeek 的解方,是巧妙运用“双随机矩阵”(Doubly Stochastic Matrix)规则,搭配 Sinkhorn-Knopp 算法,为讯号戴上“紧箍咒”。这强制实践了严格的“能量守恒”:保证无论讯号如何混合,流入的总量必须精确等于流出的总量。
这项突破同时达成了 ResNet 时代无法想像的两大目标:
性能爆发:O留多通道互联带来的海量资讯丰富度,实现潜能极大化。
稳定压制:N讯号严格锁定在安全的范围内,完美致敬并超越了 ResNet 当年对“恒等映射”的追求。
稳定性从 3000 狂降至 1.6 成本仅增 6.7%
https://news.cnyes.com/news/id/6296197