2 905
Subscribers
-124 hours
+47 days
+730 days
Posts Archive
2 905
Finite time blowup for an averaged three-dimensional Navier-Stokes equation | What's new
https://terrytao.wordpress.com/2014/02/04/finite-time-blowup-for-an-averaged-three-dimensional-navier-stokes-equation/
2 905
Repost from quick paster
葫芦娃其实是最早的 MoE 架构。
七个兄弟是挂在同一个系统里的七个 specialized experts:大娃负责力量和体型扩展,二娃负责视觉与听觉感知,三娃负责高防御,四娃、五娃分别处理火系和水系能力,六娃负责隐身,七娃则直接持有高权限法器。
这套系统的问题从来不是 expert 不够强,而是 router 太差。
每次遇到任务,系统都会根据当前问题激活一个看起来最匹配的 expert,然后让他单独进入副本。结果就是单专家能力很强,但跨专家协同极差:二娃明明已经完成环境感知,却没有把 observation 写入 shared memory;三娃有防御能力,却没有承担 tank;四娃和五娃本可以做组合控制,偏偏始终串行调用。
这就是典型的 MoE 利用率问题:expert specialization 做得很好,orchestration 几乎没有。
而且蛇精很快发现了这个漏洞。她根本不需要正面打赢整个系统,只需要针对当前激活的 expert 做 adversarial routing,把每个葫芦娃分别诱导进自己最不擅长的任务空间,就能逐个击破。
所以真正完成系统升级的,不是某一个葫芦娃继续 scaling,而是最后七个 expert 融合成葫芦小金刚,第一次把 perception、planning、defense、tool use 和 execution 压进了同一个统一策略里。
大家小时候以为《葫芦兄弟》讲七兄弟救爷爷。
长大以后才发现,它讲的是一个 MoE 系统,因为 router 和 agent orchestration 没做好,被 prompt injection 打到反复团灭。
2 905
外籍个人分红免征个税,终结!
@慕有枝613:
发布视频 播放量:9681 弹幕:16 评论:80 点赞:572 投币:27 收藏:127 转发:94 发布日期:2026-09-01 09:47:44
2 905
Repost from 元素法典 黑车驾校
GLM-5.3-Flash
该模型拥有 3200 亿个总参数,但仅有 180 亿个活跃参数。在各项基准测试和实际应用场景中,其性能均优于 GLM-5.2。
而且,其成本仅为 GLM-5.2 的十分之一。在编程和智能体相关任务上,其性能则可与 Claude Opus 4.8 相媲美。
https://huggingface.co/zai-org/GLM-5.3-Flash
#GLM #GLM-5.3-Falsh
支持多模态,1M上下文
