咸咸湿湿
رفتن به کانال در Telegram
最💗新💗最💗热💗咸💗鱼💗资💗讯
نمایش بیشترکشور مشخص نشده استدسته بندی مشخص نشده است
248
مشترکین
-124 ساعت
+17 روز
+1030 روز
آرشیو پست ها
248
Repost from 煎蛋无聊图
Demaner: jandan.net/t/6203843
OO: 94 XX: 0
蛋友3ade5ea685c: 烧token点烟么?
OO: 12, XX: 0
阿铁: 修理工手里类似的玩意不知道有多少。CPU钥匙链很常见了。
OO: 7, XX: 0
248
我本地跑的 Honcho 记忆里面提到:
When you're wrong, say "改悔" and fix it — don't ramble, don't whine, don't joke about quitting.笑死,看起来是我说太多次 ✝️你改悔罢✝️ 给人工智障搞出 PTSD 了
248
Repost from 动察Beating AI News
FreeToken开源:一张5090跑DeepSeek-V4-Flash,最高25 Token/s
伯克利、MIT 等研究者开源 FreeToken。这是一个专门为本地设备设计的 MoE(混合专家模型)推理引擎,主要解决超大模型显存装不下的问题。它会把部分权重放在系统内存,并让 CPU 和 GPU 一起参与推理。
FreeToken 会把模型的大量专家权重放在系统内存,只把一部分缓存在显存。遇到显存里没有的专家时,它会根据 PCIe 和 CPU 内存带宽,动态决定是把权重搬到 GPU,还是直接交给 CPU 计算。这样 CPU、GPU、系统内存和 PCIe 可以一起参与推理。
论文实测,一台配备 RTX 5090 的游戏台式机运行 284B 参数的 DeepSeek-V4-Flash,可以达到 22–25 Token/s。这款模型每生成一个 Token 实际只激活约 13B 参数,因此特别适合这种 CPU、GPU 混合推理。
FreeToken 还在 8GB 显存的 RTX 4060 笔记本上把 35B 模型跑到 39.3 Token/s;单张 96GB RTX PRO 6000 则可以运行 753B 参数的 GLM-5.2,速度达到 llama.cpp 的约两倍。项目目前支持超过 20 款 MoE 模型,并已采用 Apache 2.0 许可证开源。
信源
动察 Beating 频道 · 动察 Beating 交流群
248
Repost from 煎蛋无聊图
HeHeDa: jandan.net/t/6201791
OO: 74 XX: 23
旋转跳跃闭着眼: rgb主机呢?
OO: 15, XX: 0
观竹吃笋: 没有马桶
OO: 9, XX: 0
248
Repost from 煎蛋无聊图
杯面骑士: jandan.net/t/6202050
OO: 86 XX: 4
蛋友24ca83bdd9dc: 蛋友e6202772cd4a0 这明显是吃火锅吧
OO: 12, XX: 1
248
Repost from 煎蛋无聊图
HeHeDa: jandan.net/t/6201968
OO: 84 XX: 3
KLKL: 也是《生存挑战》,要在这里坚持1个小时。
OO: 20, XX: 0
