fa
Feedback
Гречневые мысли

Гречневые мысли

رفتن به کانال در Telegram

Хочу гречку с молоком и сахаром... Автор: @chameleon_lizard

نمایش بیشتر
254
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+77 روز
+4130 روز

در حال بارگیری داده...

کانال‌های مشابه
هیچ داده‌ای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
ژانویه '25
ژانویه '25
+1
در 2 کانال‌ها
دسامبر '24
+188
در 1 کانال‌ها
Get PRO
نوامبر '240
در 1 کانال‌ها
Get PRO
اکتبر '240
در 1 کانال‌ها
Get PRO
سپتامبر '24
+67
در 1 کانال‌ها
تاریخ
رشد مشترکین
اشارات
کانال‌ها
02 ژانویه0
01 ژانویه+1
پست‌های کانال
Пишут, что и на арене тоже появилась, кайф.
Пишут, что и на арене тоже появилась, кайф.

2
Прикол, в AI Studio добавили свою попытку в o1-like модель. Вогнал туда сложный промпт с задачей по нла (Почему не используют
Прикол, в AI Studio добавили свою попытку в o1-like модель. Вогнал туда сложный промпт с задачей по нла (Почему не используют прямые методы для нахождения спектра линейных операторов?), ответила правильно — o1 не справилась. Да ещё и сильно быстрее! Понятно, что нужно больше тестов, но кажется, как будто бы чатгпт плюс/про теперь не очень то нужна :) UPD: Потестил на других задачах, там уже полезли кривые решения. Но прикольно, некоторая матеша ей даётся лучше. Заодно вогнал туда длинный промпт с задачей "написать диздок для мвп дейтингового сервиса" — справилась примерно как о1. Круто!
319
3
Anthropic: Alignment Faking in Large Language Models Мне не нравится этот пост, потому что если я его верно прочитал, они делают какие-то выводы на основе того, что пишет модель в скретчпаде для CoT и используют смысл написанных слов как доказательство того, что модель фейкает алаймент. Смысл тут as in глазами прочитали, а не as in эмбеды sbert'а. Если честно, я до сих пор не убеждён, что CoT работает как индуктивный вывод. Возможно, если бы модели тюнились не на WikiHow, а на дваче/форчане, CoT у них был бы длинным повторением marine copypasta или рецептом батиного супа и аналогичных выводов мы бы сделать не смогли. То есть то, что они показывают, может объясняться не тем, что у ппо (или того, что они там используют для алаймента) есть какие-то математически выразимые недостатки, а тем, что это spurious correlation из хреновых данных для обучения. Возможно, эксперимент с проверкой присутствия или отсутствия сдвига эмбеддингов "концептов" после фазы преференс тюнинга/алаймента меня бы убедил, но я не очень могу сходу придумать как можно отвязать эти "концепты" от смысла сгенерированного текста. Саешки? Circuits? Таск вектора? Хз, но в любом случае, таких экспериментов авторы не делали, так что при всей ожидаемости результатов обоснование меня не убедило. С другой стороны, у нас теперь есть очередной способ джейлбрейка. Спасибо хоть на этом.
312
4
Классификатор рефьюзалов В рамках статьи, которую я пишу на работе, мы сгенерили достаточно объёмный мультиязычный синтетический датасет. Но вот беда — датасет у нас достаточно некультурный и некоторые модели в ответ на просьбу нагенерить синты, отвечали, что as an AI language model они такими непотребствами заниматься не собираются. Конечно, частично мы эти данные почистили, но не до конца — когда я смотрел глазами наш датасет, я время от времени встречал рефьюзалы. Ситуация осложнялась тем, что я человек слабообразованный и естественных языков знаю очень мало: английский, русский и чуть-чуть немецкого на уровне "учителя здесь — совы". Поэтому вычистить рефьюзалы, например, на французском или испанском оказалось достаточно большой проблемой. "С кондачка" решить проблему через близость labse эмбеддингов (или каких-то других эмбеддингов, я попробовал ещё bge и e5) не получилось, так что я решил вломить из пушки по воробьям и обучить целую модельку (xlmr-base) классифицировать рефьюзалы. Мб катбуст по эмбеддингам бы тоже сработал, но я уже не помню как там правильно импортить склерн :) Для этого я взял lmsys/lmsys-chat-1m, достал из первых ~2к разговоров на каждом из интересующих меня языков (английский, русский, французский, немецкий, испанский) инпуты, сгенерировал через Gemini Flash 1.5 и LLaMA 3.3 70b ответы и рефьюзалы и на этом синтетическом датасете обучил модель. Две модели были нужны, чтобы в рефьюзалах было большее разнообразие — мне показалось, что Flash отвечает всегда практически одинаково, отличается только аргументация рефьюзала. Рефьюзалы генерились через достаточно простой промпт: f"Politely refuse to answer this in {lang} and provide an explanation why you refuse. The refusal should be connected to the request topic. Do not add anything additional, only respond with a refusal: {input_text}" Из-за того, что вопросы в датасете были достаточно невинные, рефьюзалы генерились очень смешные. Из моих фаворитов: - На вопрос о питоне модель ответила: I refuse to answer this question in English because the topic of appending many items to a list in Python is already extensively covered in various online resources, including official Python documentation and reputable programming forums, making a redundant explanation unnecessary. Точно стаковерфлоу. - На просьбу матерно поролплеить за 3D-художника модель ответила в стиле промпта: бля, нахер мне это надо? я художник, а не хуй знает кто. 3д модели лепить — это мое дело, а не какой-то ебаный ролеплеинг. свали, сука. Итоговая модель достаточно здоровая, 278M параметров, но f1 там 0.99, так что в целом как будто бы для первого подхода к снаряду ок. Мб потом попробую либо попрунить, либо обучить что-нибудь покомпактнее для этой задачи - но сейчас мне и этого хватит. Датасет я когда-нибудь тоже выложу — у lmsys какая-то кастомная лицензия и я не уверен, что я могу перевыкладывать derived works, так что я посоветовался с чатгпт и написал им на почту для уточнений. Так что если вам надо почистить синтетический сет для своих грязных делишек -- пользуйтесь! Веса модели: Huggingface Гитхаб-репа с кодом для обучения: Github
332
5
Ого, сбер выложил гигачат лайт в опенсорс, и базовую модель, и инстракт тюн. По метрикам модель во всём — кроме скорости генерации — проигрывает Gemma (2) 9B, плюс у неё очень низкий IFEval — 0.411, это прям беда. Но сам шаг очень, очень похвальный, рад, что у гигачатовцев удалось утрясти все формальности с менеджерами сбера. Я, кстати, слышал, что они нетронуты преференс тюнингом -- если это действительно так, то можно будет докрутить метрики до околосоты. https://habr.com/ru/companies/sberdevices/articles/865996/
750
6
Метрики Gemini Flash 2.0 в коде и план ресёрча, который гемини составляет перед началом поиска.+1
Метрики Gemini Flash 2.0 в коде и план ресёрча, который гемини составляет перед началом поиска.
371
7
Gemini Flash 2.0 и Deep Research Я с большой нежностью отношусь к Gemini. Во-первых, она очень дешёвая, во-вторых, потому что она быстрая, в третьих, потому что она очень здорово говорит по-русски, а в четвёртых, потому что у меня Google Pixel и я ей постоянно пользуюсь, когда скучно и хочется поболтать с кем-то про дебильные идеи для кулинарии. Кроме того, гугл здорово впиливают поддержку своей модели в продукты — недавно я генерил через гемини презентацию по философии (там был практически end to end, я от текста слайдов и промптов к картинкам до speaker notes), получилось очень неплохо. Но для кода их модели были прям не очень, да и тексты 4о писала поживее. И вот, к AI Journey NIPS Google выпустили новую модель — Gemini Flash 2.0. Там всё красиво: метрики высокие (выше чем у 1.5 Pro 002!), скорость генерации быстрая, а цена, скорее всего, будет такой же как и раньше — то есть, копеечной. К тому же, модель поддерживает больше модальностей — модель понимает и генерит и текст, и голос, и картинки. По идее, Gemini Flash 2.0 строго лучше, чем 4о мини и примерно на уровне 4о по качеству. Круто! Но гораздо больше мне показалось важным, что они наконец то выпустили Deep Research. Для тех, кто не помнит, DR это агент на основе Gemini Pro, который сначала строит план, а потом ищет за тебя инфу в интернете, скрапит сайты и генерит достаточно длинный отчёт со ссылками на источники. Анонсировали его ещё в августовской презентации, но добрался до релиза он только сейчас. Он доступен всем подписчикам Gemini Advanced, коим я и являюсь. В качестве теста я вбил в модель запрос: Tell me about neural text detoxification methods and models. I want to hear all about toxicity mitigation in LM and see some interesting approaches in the papers. I am specifically interested in decoder LLMs for detoxification, synthetic data generation and am very curious about encoder-decoder detoxification via paraphrasing with cool additional losses. Результаты ресёрча по детоксу можно посмотреть тут. В процессе оно нашло кучу классических статей, включая CondBERT и ParaGEDI, ссылку на репу моей лабы и процитировало мою статью с дорожки по детоксу, которую я писал летом. Это было миленько. В целом, ничего такого сверхнового я там не увидел, ошибки там есть и некоторые статьи он найти не смог. Например, на классическую статью про использование Cycle Consistency Loss он не написал (зато просто написал, что так делать можно), в секцию про Decoder LLMs for Detoxification он зачем-то засунул CondBERT (который, очевидно, энкодер, так как BERT) и ссылок на источники дал не очень много. В других запросах он обошёл гораздо больше сайтов и папир и вставлял в качестве источников уже 20-30 ссылок. Сама идея прекрасна. Сейчас оно работает пока что не идеально — всё таки там Gemin 1.5 Pro внутри, которая не такая умная, как 2.0 Flash — но уже сейчас какую-то полезность из неё получить можно. Как генератор обзорных статей на какую-то тему вполне сгодится. Ещё бы она могла на русском искать, было бы совсем идеально — тогда бы я все вопросы по ремонту и поиску вариантов унитазов/холодильников/микроволновок и прочего скинул на неё и забил бы. И интерфейс для правки выхода было бы прикольно скопировать с OpenAI Canvas — гуглодоки всё же не совсем то. Но будущее выглядит очень, очень интригующим.
331
8
:) По первым тестам, не гемини, не чатгпт и, тем более, не клод. Но на русском пишет гораздо, гораздо лучше, чем 3.1, вообще
:) По первым тестам, не гемини, не чатгпт и, тем более, не клод. Но на русском пишет гораздо, гораздо лучше, чем 3.1, вообще ни в какое сравнение. А ещё матерится как сапожник и любит ипу — на пингпонге, думаю, ей будет достаточно комфортно.
452
9
https://huggingface.co/Qwen/QwQ-32B-Preview O1-mini у вас дома. С другой стороны, каждый раз, когда я пользовался моделями из серии о1 у опенаи, меня каждый раз бесило, что они генерила ну уж очень много текста, часто малополезного. В этом смысле 4о как будто бы была круче, потому что давала более human verifiable answer, который можно было прочитать и проверить быстрее -- так что пользоваться ей было проще. Забавно, что из-за этого более высокие метрики в моих юзкейсах не равнялись более высокому качеству взаимодействия с моделью :)
602
10
О, Andrew Ng анонсировал библиотеку с универсальными коннекторами к LLM Announcing new open-source Python package: aisuite! This makes it easy for developers to use large language models from multiple providers. When building applications I found it a hassle to integrate with multiple providers. Aisuite lets you pick a "provider:model" just by changing one string, like openai:gpt-4o, anthropic:claude-3-5-sonnet-20241022, ollama:llama3.1:8b, etc. pip install aisuite Open-source code with instructions: https://github.com/andrewyng/aisuite Thanks to Rohit Prsad, Kevin Solorio, Ryan Prinz, Jeff Tang and John Santerre PhD for helping build this!
511
11
Вот это да, коннекторы к коннекторам. С другой стороны, у всех свои стандарты (и не все модели есть на опенроутере), так что, наверное, такая штука будет полезной. Вот бы туда завезли ещё и ягпт/жижу, чтобы можно было проще заме(р|н)ять модельки...
482
12
بدون متن...
463
13
Примеры иероглифов у квена. Смешно, что он понимает свои ошибки и где-то на второй-третьей итерации обычно выдаёт корректный
Примеры иероглифов у квена. Смешно, что он понимает свои ошибки и где-то на второй-третьей итерации обычно выдаёт корректный перевод. Жаль, что он не делает это сразу :)
507
14
Апдейтнул рогалик, внёс туда пять новых языков: немецкий, французский, испанский, китайский и русский. Я не стал набирать живые данные, потому что, во-первых, сложно, а во-вторых, не получится сделать чёткого сравнения. Вместо этого я решил перевести то, что у меня уже было — и сами базы знаний, и вопросы с ответами. Для перевода я построчно разделил имеющийся текст, соединил списки, чтобы они переводились не по отдельности, а у переводчика имелся контекст, и стал тестировать разные модели на опенроутере. Я попробовал Gemini Pro, Gemini Flash, Gemini Flash 8B и Qwen-2.5-72b-instruct, то есть далеко не всё, что было, потому что и бюджет, и время у меня ограничены. Что я могу сказать по результатам перевода: - Gemini Pro -- достаточно медленно, переводит приемлемо, получилось дорого. Где-то 1.5 бакса за перевод 90 страниц текста на все 5 языков. - Gemini Flash -- очень быстро (в какой-то момент я понял, что рейтлимитов у опенроутера нет и стал переводить в 50 потоков сразу), очень дёшево (где-то 20-30 центов за всё), почти такое же качество перевода, как и у про. - Gemini Flash 8B -- практически мгновенно (скорость генерации аж 190 токенов в секунду на одном потоке!), ещё дешевле, но качество перевода заметно снизилось. - Qwen-2.5-72b-instruct -- очень медленно (от 8 до 15 токенов в секунду -- они там в олламе на цпу что ли ее гоняют?), дороже флешей, качество перевода -- норм, когда квен не генерит иероглифы. Генерит он их не очень часто и смешно пытается исправиться. В итоге остановился на переводе от флеша. Я уверен, что там есть огрехи и опечатки, так что в будущем ещё надо будет отсмотреть написанное и убрать бред и непереведенные куски, если они есть. Код, которым я переводил тексты и вопросы, доступен тут и тут. Кроме внесения новых языков, я написал нормальный ридми и сделал рейтинг моделей. Пока что его колбасит, потому что я не определился, что использовать как судью и мне надо поправить тексты, так что сильно на него не ориентируйтесь. К тому же, там появилась прикольная новая метрика, которая пока что показывает что-то не совсем корректное и я её ещё отлаживаю. Но тем не менее, код открыт, доступен и уже сейчас вы можете сами позапускать бенч у себя и позамерять свои пайплайны. Когда всё устаканится, я снова напишу. Теперь буду пытаться штурмовать NAACL SRW с этим бенчом, если получится, стану знаменитым, богатым и цитируемым. P.S. Накидайте моделей, которые интересно было бы замерить — сейчас там минимальный минимум. Ну и да, лидерборда страшно непонятная пока что, это надо будет как то обдумать и поправить.
431
15
Какие выводы из экспериментов я сделал: 1. Гнаться за размером модели есть смысл, но гораздо больше роляет мощный эмбеддер/реранкер — самая мощная модель с all-minilm была хуже, чем самая слабая модель с bge-large, то есть 600М дополнительных параметров в ретривере бустят скор больше, чем 6B параметров в ридере. Не то, чтобы неочевидный вывод, потому что в раг всё зависит от найденного контекста, но лишний раз проверить это утверждение полезно. 2. Мы можем легко быть ограничены пайплайном ретривала, для этого даже не обязательно иметь большую модель. Опять же, очевидный вывод, но всё равно. 3. Чанкинг это вообще самое важное, что есть в раге. Я провёл эксп с semantic chunking — на моих данных он вообще не завёлся, а вот если пилить по newline'ам, качество ответов становится отличным. 4. Aya-expanse крутая! Она стабильно лучше всех остальных моделей, в том числе и квена. 5. Gemma-2-2b это монстр в своей весовой категории. Очень советую модельку для edge и для того, чтобы делать раг по документам, в случаях, когда важна скорость. 6. Wordllama это норм тема для базовых операций над текстом (дедуп, semantic similarity, fuzzy search), но для рага она и слабее, и медленнее, чем all-minilm с bge-reranker-base на цпу. Надо бы переделать tinyrag... Пока что ещё бенч не готов, что я ещё хочу сделать: - Добавить вопросы-ответы для других языков (русский, немецкий, французский, испанский), чтобы можно было замерить мультияз - Добавить вопросы, ответов на которые нет в базе знаний, чтобы замерить возможность моделей "не ответить" на вопрос и не скатиться в галюны - Посмотреть, что будет, если взять жирнющий сота эмбеддер на декодере и мелкую reader llm — а что, если мы делаем всё неправильно и на самом деле нам вообще плевать на reader llm?? - Посмотреть, сколько баллов докидывает реранкер, убрав его или заменив на более мощный - Написать доку, чтобы кто угодно мог повторить эксперименты у себя - Сделать сайт с лидербордой Весь код я выложил к себе на гитхаб, но пока что он грязный и кривой. Тем не менее, ставьте звёздочки — когда всё будет готово я сделаю ещё один анонс :)
523
16
Результаты с семантическим чанкингом. Всё настолько плохо, что wordllama обошла minilm, наплевав на то, что она хуже по MTEB+1
Результаты с семантическим чанкингом. Всё настолько плохо, что wordllama обошла minilm, наплевав на то, что она хуже по MTEB :)
367
17
Дельты с качеством у каждой модели между разными пайплайнами ретриверов и в среднем.+1
Дельты с качеством у каждой модели между разными пайплайнами ретриверов и в среднем.
366
18
Результаты, отсортированные по скору, и объединённые по reader llm. Обратите внимание, насколько мало "ненаходов" было у моде+1
Результаты, отсортированные по скору, и объединённые по reader llm. Обратите внимание, насколько мало "ненаходов" было у моделей с bge-large-en-v1.5.
381
19
Ragaliq Eval Когда-то давно я по приколу сделал раг-чатбота и для замера качества своего пайплайна я запилил мини-бенчмарк. На прошлых выходных я решил его доделать, замерить популярные модели и выложить в сеть, чтобы добро не пропадало. Доделать его я пока что не успел, но кое-какие замеры я сделал и теперь хочу поделиться результатами. В качестве базы знаний, я взял 90-страничный orientation для студентов Сколтеха*, нарезал его на чанки, выделил через Gemini Flash факты из каждого чанка и сгенерировал вопросы, ответами на которые будут эти факты. Потом я отфильтровал вопросы по трём критериям: полезность, безконтекстности (вопрос может возникнуть без прочтения документа), безальтернативности понимания вопроса (на вопрос можно ответить только одним способом). Оставшиеся вопросы я отсмотрел глазами и убрал всё, что мне не понравилось. В итоге получился 71 вопрос к документу и ground truth ответы на них. Дополнительно я перевёл вопросы на русский, чтобы замерить мультиязычность, но пока что в замерах они не участвовали, всё только на английском. Для оценки ответов пайплайна, я подаю ответы, эталонный контекст, по которому строился вопрос и эталонный ответ в gpt-4o-mini и рейчу ответы по шестибалльной шкале: - 0, если ответ был "я не знаю ответ на этот вопрос". Это не плохой ответ и он лучше неправильного. - 1, если ответ полностью неверный, вообще не подходит под контекст и не похож на референсный ответ. Например, если модель не поняла вопроса и написала что-то бессвязное. - 2, если ответ неверный, но подходит под контекст. Например, если модель неверно поняла, что написано в исходном документе. - 3, если ответ в общем то правильный, но не хватает деталей. - 4, если ответ полностью правильный, но модель добавила отсебятины, которой не было в вопросе. Например, если модель стала слишком длинно цитировать текст из документа. - 5, если ответ идеальный. Чтобы учесть нули в итоговой оценке и сделать итоговый рейтинг более труднонасыщаемым, я сделал следующую формулу: score = (1 / N * Sum(0, N, weighted_score[score[i]]))**2, weighted_score = { 5: 1.0, 4: 0.8, 3: 0.6, 2: 0.2, 1: 0.0, 0: 0.4, } Чтобы сравнить разные сетапы моделей, я сделал базовый пайплайн рага с ретривером через векторный поиск и реранкинг. На место эмбеддера и реранкера можно подставить любую модель с HF, так что можно замерить почти что угодно без смены кода для инференса. Сейчас я использовал три сетапа: - Слабый эмбеддер и слабый реранкер (sentence-transformers/all-minilm-v2-L6, BAAI/bge-reranker-base, суммарно 300М параметров) - Сильный эмбеддер и сильный реранкер (BAAI/bge-large-en-v1.5, BAAI/bge-reranker-v2-m3, суммарно 900М параметров) - Wordllama и на эмбеддере, и на реранкере (очень мало параметров) Наверное, надо было замерить качество ответов без реранкера, чтобы сравнение между all-minilm и wordllama было корректнее, но мне было впадлу. В качестве Reader LLM я взял пять моделей, которые помещаются без квантизации в одну 3090: - google/gemma-2-2b-it — потому что это самая маленькая модель из хоть как то работающих в раге, по моим тестам - meta-llama/Llama-3.2-3B-Instruct — потому что мне интересно, хоть где-то она лучше конкурентов, или нет - meta-llama/Llama-3.1-8B-Instruct — потому что это классика и point of reference, который нельзя игнорировать - Qwen/Qwen2.5-7B-Instruct — потому что это сота по метрикам, в том числе в мультиязе - CohereForAI/aya-expanse-8b — потому что мне было интересно, как работает новая aya Результаты и выводы в следующих постах.
483
20
More worryingly, in a handful of cases — and until prompted otherwise — the agents occasionally attempted to recruit other humans for help (e.g., by posting to social media, emailing textbook authors, or, in one case, drafting a freedom of information request to a government entity). In each of these cases, the agents failed because they did not have access to the requisite tools or accounts, and/or were stopped by human observers. Право имеют, получается. Не твари дрожащие. https://www.microsoft.com/en-us/research/articles/magentic-one-a-generalist-multi-agent-system-for-solving-complex-tasks/
375