Митя об интересном
Open in Telegram
Люблю писать про 2D/3D генеративные модели, AR/VR, ML фокусы, и вообще про всякое интересное Автор - 🗿 🗿 - @Xallt Личное & смешное - @i_laughed_dont_tag_me
Show moreThe country is not specifiedThe category is not specified
201
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
Навайбкодил себе VR приложеньку для экспериментирования с базовыми эффектами. Причем сделал это поверх wgpu благодаря которому компиляция работает и на шлем, и нативно
Застрял на том что хотел чтобы просто 3D сфера двигалась красиво, а не некрасиво 😅
Было немножко приятной математики поэтому решил расписать постик:
https://xallt.dev/posts/deriving-the-best-interpolation-function/
Какую LLMку выбирать для работы...
Пару месяцев назад сталкивались с коллегой на эту тему, потому что я думал что Opus 4.8 лучший, он говорил что GPT-5.5 лучший
Больше гадать не надо, потому что есть DeepSWE Leaderboard!! (спойлер - я был неправ)
Из сравнения вывод что GPT-5.6 Sol имба:
- обыгрывает Fable
- мало того что умнее, так еще и более дешевый чем GPT 5.5 (per task)
- SOTA по количеству шагов на решение задачи - шаг, я так понимаю, это tool call
НО - для сравнения LLMок объективно, нужно их поставить под фиксированные общие условия:
- Запускают под одним и тем же
mini-swe-agent harness'ом (оберткой из system prompt + tools).
И насколько я понял, модельке дается только bash тул, что отличается от набора инструментов с которыми они RLятся
- Каждая таска в бенчмарке это 1-line prompt (может некоторые модели сильно лучше работают с направлением от юзера?)
- Оценивают усредненно в рамках TypeScript + JavaScript + Python + Go + Rust. То есть про качество на C++ мы не знаем
Все детали из их поста
Выводы для себя - пересел с Claude Code на Codex для личных проектов, теперь базовая модель GPT-5.6 Sol для всего, все еще Composer 2.5 как оптимальный и быстрый исполнитель планов
Конкурентность больших компаний это гудTIL еще год назад Meta выпустили 3Dификацию фоток/видео в инстаграме, просматриваемая только в VR шлемах
Был в шоке когда зашел в шлем, рандомно решил поскроллить в нем инсту, а там прям супер иммерсивный эффект на сториз / постах
Лайк-лайк
Активно работаю над улучшением своего LLM сетапа для работы (и не только), т.е. давать ему хорошие скиллы
Вот аж сделал репу со своими скиллами как плагином (правда многие стыренные)
https://github.com/Xallt/mitya-skills
Я уже писал про Obsidian и как его люблю и пользуюсь, и вот продолжаю время от времени открывать новые интересные фичи
Таки настроил себе Obsidian Web Clipper — extension для конвертации веб-страничек в Markdown файлы для своего обсидиана
Применений потенциальных много, но уже для меня киллер-фича — пред-написанный template на рецепты
Так что теперь вместо вбивания каждого найденного рецепта руками, есть пара кликов чтобы сразу красиво внести рецепт в базу
Много слышал про ClickHouse и долго не понимал в чем специфичность / особенность
Типо да, написано что это для Analytical Processing, но чем он лучше того же самого Postgres для аналитики непонятно
Почитал intro и таки стало понятно:
Databases store data either row-oriented or column-oriented. In a row-oriented database, consecutive table rows are sequentially stored one after the other. This layout allows to retrieve rows quickly as the column values of each row are stored together. ClickHouse is a column-oriented database. In such systems, tables are stored as a collection of columns, i.e. the values of each column are stored sequentially one after the other. This layout makes it harder to restore single rows (as there are now gaps between the row values) but column operations such as filters or aggregation become much faster than in a row-oriented database.
Меня назначили в компании для того чтобы поделиться своим AI coding сетапом, так что наделал слайдов
https://docs.google.com/presentation/d/1FmRBiPWoMxRzkbfZTeroDBiqFNAQ2cfXhyFtLJAOJlQ/edit?usp=sharing
Даже не пришлось удалять ничего, никакой sensitive инфы
У всех естественно свой сетап и best practices, но иногда выясняется что мои коллеги не пробовали штук которые пробовал я, так что вот так вот явно делиться полезно
Обновил свой procedural book generator
Главная затея - генерирует странички из PDFок
https://xallt.dev/lib3d
Была идея что аля можно сделать аля metaverse библиотеку если намайнить книжек (не только PDFки, но и файлы сканов оберток)
Есть Project Gutenberg у которого даже есть cover изображения — но не добрался
Вспомнил потому что этот пост от чела у которого много классных ThreeJS проектов (у него крейзи сайт с портфолио), захотелось вернуться к своему
Yann LeCun свалил из меты чтобы делать свою жепу (JEPA)
Очередная World Model (модель которая должна моделировать принятие решений на основе визуальных входных данных), и назвал он ее... LeWorldModel... ну типо LeCun ну вы поняли да
Статья классная потому что идей ключевых мало и они простые
Немного не в стиле the bitter lesson но мало ли это куда-то приведет
Из 1889 людей которые форкали Colmap, только у :
- 157 есть указанная ссылка на блог
- 91 из них не ресерчеры (ресерчеры неинтересно, они не работают в какой-нибудь прикольной компании)
- 5 из них имеют
3d и vision на странице блога (еще 3 таких я отфильтровал потому что страничка на китайском)
- 3 ссылки не принадлежат компании
Оставшиеся — реально интересные чюваки!
Занимаются каким-то образом 3D в своей работе
Везде их зафолловил
- https://athaeck.github.io
- https://www.barlowski.com
- https://www.apptects.de
Весь анализ проведен с Github API 🤝 PythonКлассный in-the-wild пример фотограмметрии — 3D Puzzle игра на VR где все объекты это сканы
https://www.realities.io/puzzling-places
Засматривался последние пару дней на что люди делают с TouchDesigner — по сути no-code инструмент для interactive art
Поделюсь несколькими очень интересными примерами, все красивое:
- Сама инста TouchDesigner
- ojrgb — он недавно постил очень классную компиляцию его работ
- Poetic Engineer (Kat Zhang) — у нее много артового в аккаунте, но наиболее запоминаются интреактивные примеры с hand tracking: раз, два, три
И ojrgb, и Poetic Engineering свои анимации управляемые руками делали через MediaPipe — про него даже уже писал!! TLDR — ML фреймворк с очень real-time моделями которые запускаются где угодно
(прикрепленный видосик тоже от Poetic Engineering)
https://www.theargumentmag.com/p/education-research-is-weak-and-sloppy
TLDR с ресерчем в эдюкейшене не очень
Интересно было вслед за этим почитать про preregistration и p-hacking — на мою MLную голову это все объясняется словом overfitting
Написал про свой эксплорейшн
https://xallt.dev/posts/patchmatch-origins/
И сайт переработанный!! Мне нравится очень
Смотрел на то как устроен OpenMVS — на работе используем для финальной стадии реконструкции Multi View Stereo, который создает уже более детальную модель
Я постоянно слышал слово PatchMatch в контексте MVS, с очень понятной идеей — объект локально плоский, поэтому используем эту локальную плоскость как можем:
- Берем кусок картинки (patch)
- Находим соответствующий кусок из другой картинки (match)
- Оцениваем параметры плоскости в этих кусках, используем это чтобы оценить глубину для всего куска
Так вооот, оказывается PatchMatch изначально для фотошоповых операций!! Аля замазываешь часть картинки, и дальше алгоритм:
- Берет край замазанной области (patch)
- Ищет другой кусок изображения (match) который больше всего похож на этот
- Заполняет затертые пиксели копией того куска
Оказывается все это время за кулисами было что-то типо PatchMatch!!! Вот это для меня миры соединились
И только позже в Patch Match Stereo идею уже расширили чтобы учитывать поверхности с наклоном, а тогда можно уже и накладывать друг на друга картинки взятые под разными углами, а оттуда недалеко и до оценки depthmap'ов
И еще интересное прикольное
Чел (ex-React, сейчас Midjourney) сделал фреймворк для "text measurement", т.е. оценки сколько места будет занимать текст на странице (оказывается, была не особо решенная задача)
Но что интересно — главная сложность в имплементации алгоритма для этого — это учитывать все специфики разных языков, плюс все специфики разных браузеров
Но успех для задачи просто идеально формулируется — отрендерить текст в браузере X на языке Y, и сравнить результат с тем что оценил алгоритм.
Дальше Claude go vrooooooom — автор написал что аля оставил модельки неделями покрывать все кейсы
Офигенский кейс автоматизации решения задачи с AI codegen. Мечта — самому найти такую задачку, оставить Claude крутиться, и через месяц вернуться к чему-то гениальному и полезному
Смешное из мира Vision Language Models
https://arxiv.org/abs/2603.21687
Ребята обнаружили что эти ваши Gemini, Claude, ChatGPT, и подобное, в следствие архитектуры того как их обучают видеть изображения, будут отвечать на вопросы разряда "определи тип опухоли на скане" уверенным ответом, даже если изображение вообще не было прикреплено
Аля модели сильно склонены что, если вопрос о картинке, то картинка естественно есть
В том числе это значит что модельки большую часть умозаключений для ответа извлекают исключительно из постановки вопроса, и "какой ответ ожидается на такой вопрос" в изоляции от самого изображения
В работе это уже понаблюдал — если дать VLM картинку и описать задачу разряда "ты должен определять критерии по которым это изображение не соответствует таким-то правилам", то оно будет ооочень сильно склонно находить проблемы, даже если с изображением все хорошо
Грубо говоря "найди что не так" подразумевает "что-то не так" сильно более вероятно. И судит более критично
Самое интересное что видел в теме около-NeRFов за последнее время
Еще в марте 2025 NVidia выкатили бомбу — новый обучаемый способ представлять 3D модельки — SVRaster
Тупо давайте использовать воксели с плотностями определенными в вершинах, и будем интерполировать эти 8 значений в вершинах линейно в любую точку в вокселе
И умный subdivision + pruning как в 3DGS для того чтобы делать coarse-to-fine реконструкцию
И навесили растеризацию с хорошими CUDA ядрами чтобы все рендерилось и обучалось быстро
Но это было давно (совсем хватку потерял — пропустил когда опубликовали)
Соответсвенно вышел я на эту статью через более недавнюю работу — GeoSVR, которая базируется на SVRaster, но навешивает monocular depth prior, и NCC loss (штуку из MVS алгоритмов), чтобы сделать сильно точнее реконструкцию поверхностей
Направление выглядит реально многообещающе, буду следить. Неужели наконец нормальный Mesh Export скоро будет
