Блокнот Техника [📌📒📟]
前往频道在 Telegram
Блокнот. Заметки, наблюдения, мысли. Open Source: Основано на открытых источниках. Всë представленное здесь - только для ознакомления. Всë написанное - есть плод моих фантазий и мыслей. Достоверность публикуемого не гарантируется. Проверяйте сами.
显示更多1 128
订阅者
无数据24 小时
+17 天
-730 天
数据加载中...
相似频道
标签云
进出提及
---
---
---
---
---
---
吸引订阅者
十月 '2610月 '26
十月 '260
在0个频道中
九月 '26
+12
在0个频道中
Get PRO
八月 '26
+10
在0个频道中
Get PRO
七月 '26
+11
在0个频道中
Get PRO
六月 '26
+18
在0个频道中
Get PRO
五月 '26
+23
在2个频道中
Get PRO
四月 '26
+23
在1个频道中
Get PRO
三月 '26
+16
在0个频道中
Get PRO
二月 '26
+28
在2个频道中
Get PRO
一月 '26
+62
在2个频道中
Get PRO
十二月 '25
+37
在2个频道中
Get PRO
十一月 '25
+48
在3个频道中
Get PRO
十月 '25
+60
在3个频道中
Get PRO
九月 '25
+40
在2个频道中
Get PRO
八月 '25
+40
在2个频道中
Get PRO
七月 '25
+17
在3个频道中
Get PRO
六月 '25
+25
在3个频道中
Get PRO
五月 '25
+55
在3个频道中
Get PRO
四月 '25
+40
在2个频道中
Get PRO
三月 '25
+100
在3个频道中
Get PRO
二月 '25
+115
在4个频道中
Get PRO
一月 '25
+72
在4个频道中
Get PRO
十二月 '24
+134
在4个频道中
Get PRO
十一月 '24
+85
在3个频道中
Get PRO
十月 '24
+63
在4个频道中
Get PRO
九月 '24
+25
在1个频道中
Get PRO
八月 '24
+17
在2个频道中
Get PRO
七月 '24
+25
在2个频道中
Get PRO
六月 '24
+38
在2个频道中
Get PRO
五月 '24
+47
在4个频道中
Get PRO
四月 '24
+74
在4个频道中
Get PRO
三月 '24
+46
在2个频道中
Get PRO
二月 '24
+43
在2个频道中
Get PRO
一月 '24
+69
在2个频道中
Get PRO
十二月 '23
+53
在2个频道中
Get PRO
十一月 '23
+43
在4个频道中
Get PRO
十月 '23
+26
在2个频道中
Get PRO
九月 '23
+25
在0个频道中
Get PRO
八月 '23
+79
在0个频道中
Get PRO
七月 '23
+19
在0个频道中
Get PRO
六月 '23
+25
在0个频道中
Get PRO
五月 '23
+16
在0个频道中
Get PRO
四月 '23
+37
在0个频道中
Get PRO
三月 '23
+22
在0个频道中
Get PRO
二月 '23
+55
在0个频道中
Get PRO
一月 '23
+45
在0个频道中
Get PRO
十二月 '22
+34
在0个频道中
Get PRO
十一月 '22
+263
在0个频道中
| 日期 | 订阅者增长 | 提及 | 频道 | |
| 02 十月 | 0 | |||
| 01 十月 | 0 |
频道帖子
| 2 | #mem #crypto #opinion
При небольшом росте крипты вижу нарративы побуждающие криптоинвесторов фиксировать прибыли (продавать)...
Это ж когда так система беспокоилась о правильной продаже и "прибылях" толпы? Правильно -- перед ещë большими подъëмами.
📟 @tech_di | 212 |
| 3 | #work #way #VALERA #sys
46 ДНЕЙ БЕЗ ПЕРЕЗАГРУЗКИ.
46 дней почти непрерывной работы #VALERA@tech_di -- моих правок, поправок курса и движения в форватере проекта "Geffen Tower CORE".
За это время навалилось пакетов на полтора гига. Самое вкусное -- рабочая виртуальная среда через 46 дней запустилась ровно такой же, какой была в первый.
Повод для ребута -- патчи безопасности: ядро Linux + бинарники NVIDIA внедряются на самых ранних стадиях загрузки (DKMS), их нельзя ни отложить, ни править. Только перезагрузка.
Новых ускорений не получил -- апдейт был чисто по SecOps. Цена вопроса -- 2-5 минут простоя за все 46 дней.
📌 @tech_di | 261 |
| 4 | #mem #ai #opinion
Приснился следующий нейро-президент с безспорной народной поддержкой. | 260 |
| 5 | #mem #deliver #word #sence
Никогда ранее не задумывался об смысле слова ОБЕСПЕЧЕНИЕ. Хотя и считаю себя инженером по разработке ПО (Программного Обеспечения), но, получается, что я даже не понимаю при чëм тут Печень и почему нужно еë убирать 😆 | 375 |
| 6 | #mem #limon | 339 |
| 7 | #mem #real
так и есть... пока ты понимаешь что хочешь - ты это можешь реализовать | 1 |
| 8 | 没有文字... | 556 |
| 9 | ❌✴️🇪🇺#USDT #Tether #европа #крипто #стейблкоины
Генеральный директор Tether заявил, что компания отказалась подавать заявку на получение лицензии MiCA в ЕС из-за правил в отношении резервов стейблкоинов | 233 |
| 10 | #music #space #ambient
Space Ambient Music
если самое начало "зацепило", то и всё остальное также хорошо 100% =)
115 мегабайт музыки, 2 часа
большинство написано музыкантами и частично сведено с помощью нейросетки. Это тот случай, когда все в синергии
#y2021 + #y2023 | 490 |
| 11 | Продукт сантиметросодержащий 😐😏 | 298 |
| 12 | #xrp #xrpl #xls #xls40 #xls70 #fed #dao
Если говорят что "так нельзя" - то я перепроверяю... Потому что мне это нужно и для моих путей это интересно/
Не всегда перепроверка работает... но тот редкий случай, когда пере-проверил: И ЭТО БУДЕТ РАБОТАТЬ! ... мало того, это будет SOT для целого кластера решений.
XLS - это стандарт расширения сети XRPL
1️⃣
Синергия (Граф доверия): DID (XLS-40) создает суверенный криптографический «паспорт» сущности, а VC (Credentials (XLS-70)) прикрепляет к нему заверенные статусы, роли и репутацию.
2️⃣
Для федеративных сообществ: Это выводит XRPL за рамки финансовой инфраструктуры, превращая его в фундамент организационного и социального доверия. Позволяет независимым участникам (узлам, DAO, компаниям) безопасно объединяться в федерации, верифицировать членство, делегировать права и строить децентрализованные системы управления (например, кросс-организационное голосование и контроль доступа) без центрального арбитра.
Всё это на основе криптографии + WEB3
---
📌 @tech_di | 695 |
| 13 | ⚙️ XRP Ledger теперь поддерживается стандартом Open Wallet Standard и является вариантом расчетов в Stripe и Tempo
XRPL расширяет инфраструктуру для платежей ИИ-агентов. RippleX представила XRPL AI Starter Kit v1.1 — обновленный набор инструментов для создания ИИ-агентов, способных самостоятельно совершать платежи и торговать через XRP Ledger.
Главное обновление — XRPL теперь поддерживается в Machine Payments Protocol (MPP) от Stripe и Tempo. ИИ-агенты могут автоматически оплачивать сервисы в XRP и других активах XRPL, а через Payment Channels — проводить потоковые платежи.
Также добавлены Open Wallet Standard, локальная среда xrpl-up и инструмент для автономной торговли на XRPL DEX.
👉 Идея простая: сделать XRPL одной из платежных сетей для экономики ИИ-агентов.
🪙@rippleweb | 340 |
| 14 | #re #ai #tune #way #images
Иллюстрации к
https://t.me/tech_di/4629 | 422 |
| 15 | #ai #qwen #local #test #prj #way
Прогресс есть:
с 13 до 20 ток/с там, где было нормально
с 5,4 до 7 ток/с там, где было совсем тяжело
Qwen3.8-Flash-Next 125B A6B + 51B N-Gram MoE (Thinking)
Пост не про бенчмарки. Он про то, сколько можно выжать из того, что уже стоит на столе. Железо то же, модель та же, контекст не урезан.
---
Было и стало
Сравниваю не одну сессию с другой, а две свои сборки: прошлую и нынешнюю. Цифры -- сводные по множеству рабочих сессий, каждая из них разная, поэтому я свёл к характерным значениям. Смотрел по своим прогонам, в лабораторию не ходил:
На старте сессии: было 13, стало 20+
Половина окна (256k): было 8,2, стало 10+
Заполненное под 240k: было 5,4, стало ~7
Ускорение держится по всей глубине окна, а не только на лёгком старте. И именно этот хвост мне важнее всего: это не конец сессии, а штатный режим работы. Ниже объясню, почему.
✅
Сколько контекста уходит на задачу
Проект у меня живёт на документации в несколько мегабайт markdown'а, и я проектирую через TDD и веду агента строго по докам. Вот примерный бюджет одного задачи по моим прогонам:
цивра в токенах:
30-60k -- агент читает задачу: документация, рамки, ограничения. Это ещё не работа, это понимание.
90-120k -- пробует реализовать рабочую модель: подгружает код, исследует, сверяется с доками.
около 200k -- перепроверяет себя, правит, пишет dev-отчёты.
200-256k и более -- когда есть нюансы.
То есть агент не сидит в хвосте окна сутками -- он в него упирается регулярно и по делу. Весь workflow построен так, чтобы работать модульно и по направлениям, но необходимость загрузить большой контекст всплывает часто: документацию в пару мегабайт иначе не охватить.
Именно поэтому к 200k важна каждая десятая токена в секунду -- это не про комфорт, а про сколько часов уйдёт на задачу.
---
Почему вообще тормозит на длинном контексте
MoE -- это когда параметров много, а в генерации участвует лишь малая часть, "эксперты". Здесь 125B параметров и 6B активных. В 16GB VRAM такое не влезает, поэтому эксперты постоянно мигрируют между RAM и GPU туда-сюда по PCIe.
Упор оказался не в вычислениях, а в пропускной способности шины и задержках. GPU простаивает, пока едут веса.
⚡️
Лечится не "считать быстрее", а "перестать ждать". Форк llama.cpp от GenerelSchwerz (ветка qwen4exp-mtp) кэширует самых востребованных экспертов в VRAM и прячет I/O-латентность за вычислениями. Вычисления быстрее не стали -- мы просто перестали ждать шину. Никакой магии, менеджмент памяти. Ветка живая, под свою карту собрал сам, флаги сверял на месте.
Кэш убирает лишний I/O, но attention он не отменяет. Чем глубже контекст, тем дороже каждый следующий токен и больше вес KV -- поэтому кривая вниз скорости инференса никуда не делась, её сдвинуло вверх. На 240k потолок всё равно около 7 ток/с, и это потолок архитектуры, а не сборки.
Минус сразу, чтобы потом не было сюрпризов. Спекулятивное декодирование (MTP) с таким кэшем не дружит: просадка примерно в половину против ванильного. Спекуляции нужны веса "под рукой", а их как раз в VRAM и нет -- оверхед на проверку draft-токенов съедает весь выигрыш. --spec-type none, и не трогать. Речь именно про эту связку модели и конфига и сборку llama.cpp, не про метод как таковой.
---
Что говорят логи:
Вытащил из llama-swap зависимость скорости от глубины контекста (на текущей сборке):
📈
- Старт (1,7k): 13 → 22,6 ток/с (+74%)
- 80k: ~10 → ~13 ток/с (+30%)
- 130–150k: ~8 → ~10 ток/с (+25%)
- 180–200k: ~6,7 → ~8,2 ток/с (+22%)
- 230–245k: 5,4 → ~7 ток/с (+30%)
Вторая цифра любопытнее. За сессию, где на prompt пришлось 209 939 токенов, из кэша пришло 4 797 079. То есть вход агента почти целиком (96%) -- уже посчитанное ранее. Заново генерируется только ответ, а не весь разговор.
И то же самое в накоплении: за 3 часа 56 минут непрерывной работы кумулятивный кэш вырос с 82k токенов до 245k. Никаких дежурных перезапусков, скорость по мере роста счётчика не просела. Вот это и есть ответ на вопрос "а стабильно ли это" -- не словами, а цифрами.
---
📖
Дальше -- под кат: из чего именно сложилось ускорение, конфиг, ссылки
Три вещи, каждая вкладывает по-своему:
1) --ple-prefetch + --decode-overlap / --decode-boundary-overlap
Асинхронный пайплайн: пока GPU считает текущий токен через attention и активных экспертов, CPU параллельно подкачивает веса под следующий шаг и гонит их по PCIe. Идея пришла из HPC, здесь она адаптирована под MoE-архитектуру.
2) --moe-expert-cache-size
Топ-K реально востребованных экспертов живут в VRAM, остальное подгружается лениво. Меньше обращений к шине на каждый сгенерированный токен.
3) --load-mode none -- отказ от mmap
Самый непропорционально важный флаг из трёх. На многогигабайтных GGUF-шардах mmap при рандомном доступе к экспертам тонет в page faults и системных вызовах. Без mmap (вместе с grouped decode) чтение становится линейным и предсказуемым. Проверено: 128GB RAM для этого достаточно.
И наблюдение в тему, почему на коде быстрее. Роутинг в MoE детерминирован: набор экспертов зависит от входных данных. Код, документация и логи -- материал повторяющийся, активные эксперты почти не меняются, и кэш остаётся горячим. На свободной болтовне набор расползается, и выгоды меньше. Поэтому на кодовой базе модель ощущается быстрее, чем в переписке.
Ссылки:
- https://github.com/GenerelSchwerz/llama.cpp/wiki
- https://github.com/GenerelSchwerz/llama.cpp/wiki/MoE-Cache-Flags-and-16GB-Setup
- https://github.com/GenerelSchwerz/llama.cpp/wiki/PLE-Prefetch-and-Decode-Overlap#trying-the-flags
- https://unsloth.ai/docs/models/qwen3.8-next#mtp-llama.cpp-guide
Рабочий конфиг (16GB VRAM, ветка qwen4exp-mtp):
# ── Qwen3.8-Flash-Next 125B A6B (MoE) - TUNED for 16GB VRAM ─────────────
"qwen3-8-125b-flash-next-tuned":
name: "Qwen3.8-Flash-Next 125B A6B (MoE Cache Tuned)"
description: "256k context with MoE expert cache for 16GB VRAM"
macros:
"ctx-size": "262000"
"ngl": "999"
"offload-rule": "exps=CPU"
"threads": "12"
"batch": "512"
"ubatch": "512"
"kv-type": "q8_0"
"parallel": "1"
"moe-cache-size": "28" # Консервативный старт: 24 слота на тензор (достаточно для K экспертов)
"load-mode": "none" # КРИТИЧНО: отключает mmap, сохраняет grouped decode (128GB RAM достаточно)
cmd: |
${llama-bin-tuned}
${common-flags}
-ot ${offload-rule}
--model ${models-dir}/unsloth/Qwen3.8-Flash-Next-GGUF/Qwen3.8-Flash-Next-UD-IQ4_XS-00001-of-00003.gguf
--cache-type-k ${kv-type}
--cache-type-v ${kv-type}
--cache-prompt
--cpu-moe
--lazy-mode on
--spec-type none
--decode-overlap
--decode-boundary-overlap
--ple-prefetch
--parallel ${parallel}
--ctx-size ${ctx-size}
--n-gpu-layers ${ngl}
--threads ${threads}
--threads-batch 12
--batch-size ${batch}
--ubatch-size ${ubatch}
--flash-attn on
--temp 1.0
--top-k 20
--top-p 0.95
--min-p 0.0
--repeat-penalty 1.0
--presence-penalty 0.0
--frequency-penalty 0.0
--load-mode ${load-mode}
--moe-expert-cache-size ${moe-cache-size}
-fit off
checkEndpoint: /health
aliases:
- "qwen38-flash-next-tuned"
metadata:
architecture: "qwen4exp"
quantization: "UD_IQ4_XS"
ctx_size: ${ctx-size}
purpose: "Reasoning, coding, multi-step tasks (MoE Cache Tuned)"
thinking_mode: true
---
Выводы 💡
1. У имеющегося железа всегда есть резерв. Ищу его там, где болит, прежде чем считать, что потолок достигнут.
2. 125B MoE на 128GB RAM и 16GB VRAM -- это рабочий инструмент, а не демо "влезло и ладно".
3. 256k контекста подъёмны. Решает архитектура работы с памятью, а не гигагерцы и объём VRAM.
4. Если узкое место -- шина, оптимизация вычислений бессмысленна. Оптимизируй доставку данных.
5. Не принимай дефолт за аксиому: mmap хорош, когда в RAM одна модель, и вреден при рандомном доступе к экспертам.
6. Кэш экспертов раскрывается на повторяющемся контексте. Дай модели предсказуемый материал.
7. Большой контекст -- это не рекорд, а бюджет задачи. Мне 250k нужно не для понтов, а потому что документация иначе не влезет.
📌 @tech_di | 398 |
| 16 | #mem #time #life #moment | 357 |
| 17 | #dna #micro #machine #life #howto #visual #vid #yt
Видео о строении клетки и ДНК. Визуализация и анимация для понимания.
Факт в том, что современная наука до сих пор не знает как всë это устроено.
Название видео:
ДНК создал Бог? Самые свежие научные данные о строении. Как работает информация для жизни организмов
Источник: https://www.youtube.com/watch?v=TLfqcrq5ryw
---
📌 @tech_di | 378 |
| 18 | #mem #struct #phase | 290 |
| 19 | #lang #lingvo #rabota
Пословица:
Работа не волк, в лес не убежит
Еë смысл для многих перевернули. А ведь если подумать, то истинный смысл слов в том, что:
Работа неизбежна. Это волк может убежать в лес, а твоя работа здесь, никуда не денется пока ты еë не завершишь.
📟 @tech_di | 289 |
| 20 | 没有文字... | 289 |
