ch
Feedback
NLP Core Team

NLP Core Team

前往频道在 Telegram

Канал команды NLP соre. Здесь мы делимся нашими результами и мыслями в области NLP/PLP и не только. Мы авторы многих моделей для русского языка: ruBert, ruGPT2, ruGPT3, ruT5, ruRoberta, FRED-T5.

显示更多
2 674
订阅者
无数据24 小时
无数据7
+3430

数据加载中...

相似频道
无数据
有任何问题?请刷新页面或联系我们的客服
标签云
无数据
有任何问题?请刷新页面或联系我们的客服
进出提及
---
---
---
---
---
---
吸引订阅者
九月 '24
九月 '24
+53
在0个频道中
八月 '24
+43
在0个频道中
Get PRO
七月 '24
+52
在0个频道中
Get PRO
六月 '24
+44
在0个频道中
Get PRO
五月 '24
+77
在0个频道中
Get PRO
四月 '24
+79
在0个频道中
Get PRO
三月 '24
+95
在1个频道中
Get PRO
二月 '24
+69
在0个频道中
Get PRO
一月 '24
+83
在0个频道中
Get PRO
十二月 '23
+134
在4个频道中
Get PRO
十一月 '23
+128
在0个频道中
Get PRO
十月 '23
+119
在1个频道中
Get PRO
九月 '23
+172
在0个频道中
Get PRO
八月 '23
+136
在0个频道中
Get PRO
七月 '23
+170
在0个频道中
Get PRO
六月 '23
+1 547
在0个频道中
日期
订阅者增长
提及
频道
26 九月0
25 九月+1
24 九月+1
23 九月+3
22 九月0
21 九月0
20 九月+2
19 九月+2
18 九月+2
17 九月+5
16 九月+1
15 九月+1
14 九月+2
13 九月+3
12 九月+3
11 九月+1
10 九月+10
09 九月+6
08 九月0
07 九月0
06 九月+3
05 九月+3
04 九月+2
03 九月0
02 九月+2
01 九月0
频道帖子
CodeChat в GigaCode 🚀🚀🚀 CodeChat поможет оптимизировать или отрефакторить имеющийся код, сгенерировать тесты или документацию, а также объяснить или написать код под конкретную задачу. Задавайте вопросы как по всему открытому файлу, так и по определенному фрагменту кода — просто выделите его в редакторе и сформулируйте запрос к CodeChat. CodeChat умеет отвечать на вопросы не только про код. Просто обновите плагин в вашей IDE. Если еще не пробовали GigaCode то направляем вас сюда https://gigacode.ru Чуть позже расскажем про метрики нашей CodeChat модели.

2
Бесплатный Copilot Ловите небольшой подгон. Потому что, кто не знал, есть такой инструмент как GigaCode И он позволяет встрои
Бесплатный Copilot Ловите небольшой подгон. Потому что, кто не знал, есть такой инструмент как GigaCode И он позволяет встроить бесплатный ассистент по коду. В целом - удобно Надо более расширенный материал или гайд как лучше пользоваться им? 👩‍💻 - да давай 👩‍💻 - и на этом спасибо, сами разберемся
1 481
3
Вот про наше детище рассказывает популярный блогер. Приятно. Спасибо!😊
1 451
4
⚡️ruMT-Bench: генеративный подход к оценке alignment для LLM на русском языке Несколько месяцев назад мы реализовали генерати+1
⚡️ruMT-Bench: генеративный подход к оценке alignment для LLM на русском языке Несколько месяцев назад мы реализовали генеративный подход к оценке чат версий моделей основанный на MT-Bench. Выкладываем также бенчмарк в открытый доступ. Несмотря на то, что MT-Bench адаптированный под русский язык уже выкладывали , мы делимся своей версией с тщательным переводом асессорами на русский язык, и демонстрируем возможности подхода для моделей доступных на русском языке. ruMT-Bench содержит инструктивные multi-turn вопросы, разбитые по 8 различным областям знаний. GPT-4 оценивает ответы моделей по шкале от 1 до 10. Окончательная оценка определяется средним значением по всем репликам. Для некоторых сложных задач, требующих точного ответа (например, математика и код), в промт судьи (GPT-4) включается эталонный ответ, который помогает оценить ответы от модели. Замеры на корреляцию с оценками асессоров на lm-sys чат-бот арене показали [ссылка1,ссылка2], из которого следует вывод, что MT-Bench сильнее других бенчмарков на английском языке коррелирует с оценками людей. GitHub | 🤗Huggingface
4 669
5
🔥 GigaSearch теперь в Telegram- и ВК-ботах GigaChat отвечает за свои слова — на вопросы об исторических событиях и личностях
🔥 GigaSearch теперь в Telegram- и ВК-ботах GigaChat отвечает за свои слова — на вопросы об исторических событиях и личностях сервис предоставляет информацию со ссылками на источники. Перейти по ним и прочитать подробнее можно прямо из ответа. Функция работает благодаря системе генерации на основе качественной поисковой выдачи GigaSearch. 🖥 Ищите ответы в Telegram, ВК или веб-версиях GigaChat!
1 736
6
Компания Recursal AI выпустила промежуточный отчёт об обучении EagleX (RVKW-v5) модели, в котором она обошла LLaMA 2 7b на не+2
Компания Recursal AI выпустила промежуточный отчёт об обучении EagleX (RVKW-v5) модели, в котором она обошла LLaMA 2 7b на некоторых бенчмарках. Модель продолжают учить, но уже сейчас по мультиязычной перплексии модель обходит почти все остальные модели, и имеет очень хороший скор на winogrande и wnli. Это значит, что модель скорее всего будет неплохо работать на мультиязычном RAG. В glue у модели тоже подозрительно высокий счёт, авторы пишут, что проверили датасет на контаминированность и ничего не нашли. Из забавного: авторы забыли добавить датасет с математикой в обучающую выборку, так что скоры там очень плохие. Добавили обратно, так что к выходу модели с ней станет получше. Обещают к апрелю закончить обучение, прогнав через неё 2Т токенов и выпустить под пермиссивной лицензией Apache 2.0. В июле в планах обучить MoE модель, которая будет по качеству как GPT 3.5. Как здорово, что кто-то развивает архитектуры, отличные от трансформеров! 👉 Пост с анонсом 👉 Huggingface
2 052
7
⚡️ruIFEval: подход к оценке alignment для LLM на русском языке Мы сделали перевод датасета и адаптацию кода на русский язык д+1
⚡️ruIFEval: подход к оценке alignment для LLM на русском языке Мы сделали перевод датасета и адаптацию кода на русский язык для нового подхода к оценке качества LLM от Google. Подход ruIFEval оценивает способности модели следовать инструкциям на естественном языке. Он фокусируется на наборе «проверяемых инструкций», которые определяются как инструкции, поддающиеся объективной проверке соответствия, таких как «Напишите от 200 до 250 слов» и «весь ваш вывод должен быть в формате json».  В силу того, что оценки асессорами являются дорогостоящими, медленными и объективно не воспроизводимыми, и в свою очередь автоматическая оценка на основе LLM ограничена способностями оценщика LLM, то чтобы преодолеть эти проблемы, вводится подход к оценке ruIFEval, который стремится повысить быстроту, ясность и объективность автоматической оценки.  GitHub | Paper
2 695
8
💫 The-stack-v2 и Starcoder2 На прошлой неделе научная коллаборация BigCode выпустила новую серию CodeLLM Starcoder2 и новый+2
💫 The-stack-v2 и Starcoder2 На прошлой неделе научная коллаборация BigCode выпустила новую серию CodeLLM Starcoder2 и новый датасет the-stack-v2 Paper , HuggingFace The-stack-v2 создан в коллаборации с архивом ПО Software Heritage. Датасет сильно вырос в объеме по сравнению с the-stack-v1 за счет добавления источников помимо гитхаба, расширения фильтра по языкам программирования (есть даже 1С !) и включения файлов с отсутствующей лицензией. Также в the-stack-v2, в отличии от первой версии, есть возможность сгруппировать файлы по репозиториям. Правда пользоваться датасетом стало менее удобно, вместо скачивания непосредственно с HF приходится скачивать с S3 Software Heritage. Модели обучали трех размеров: 3b, 7b и 15b. Помимо the-stack-v2 в трейн сет входили сайты с документацией, вопросы-ответы со StackExchange, Kaggle ноутбуки, github issues, код в промежуточном представлении LLVM и несколько СФТ сетов. Датасеты дополнительно отфильтровывали в зависимости от размера модели. Обучали модели с 0.5 FIM rate на 3-4 триллионах токенов, по 5 эпох. Контекст увеличивали с 4к до 16к по ходу обучения. Инструктивных версий пока нет В статье много замеров на различных бенчмарках. По ним в целом кажется, что модели получились хуже deepseek-coder. Возможно помешало разнообразие источников? Статья про deepseek-coder не слишком подробно останавливается на датасете, но пишут про "quality model" для фильтрации гитхаба.
2 664
9
Замерили своим кодом. 33B тоже предиктит норм на 41.02.
Замерили своим кодом. 33B тоже предиктит норм на 41.02.
2 091
10
Интересно, что DeepSeek Coder Base 6.7B умеет в MMLU на 36.6%. Это на уровне Llama 1 7B, которая показала 36.18. В пейпере на
Интересно, что DeepSeek Coder Base 6.7B умеет в MMLU на 36.6%. Это на уровне Llama 1 7B, которая показала 36.18. В пейпере написано, что модель видела только код, английский связанный с кодом (10%) и 3% китайского. Оба языка она видела всего 260B токенов (2T*13%). Английский состоял из GitHub’s Markdown и StackExchange. А Llama 1 7B видела 1T в основном английского. Код явно помогает в MMLU? В StackExchange много про MMLU ответы? 3% китайского было достаточно? Очень хочется понять в чем причина.)🤔
1 975
11
Вот как менялся HumanEval у CrystalCoder во время обучения.
Вот как менялся HumanEval у CrystalCoder во время обучения.
1 972
12
Amber + CrystalCoder. Попались на глаза две модели от LLM360. Модели открытые и есть много сохраненных промежуточных чекпойнт+1
Amber + CrystalCoder. Попались на глаза две модели от LLM360. Модели открытые и есть много сохраненных промежуточных чекпойнтов. Также опубликовали код, которым учили модели. Есть куча метрик над всеми чекпойнтами по мере обучения. Amber 7B основана на Llama архитектуре и обучалась 1.26Т токенов на сете английского (RefinedWeb 665B, часть C4 198B и другие) + датасет StarCoder (291B). Для CrystalCoder 7B датасет брали SlimPajama (690B) и StarCoder. CrystalCoder 7B имеет ряд архитектурных изменений: LayerNorm вместо RMSNorm, 25% hidden dimensions только для rotary применяют, разный lr для разных групп параметров и другие. В пейпере не очень то поясняют логику почему они пришли к выводу так менять. Обучали CrystalCoder в 3 этапа каждый отличался сетом обучения и стартовыми гиперпараметрами обучения. Сначала учили на половине SlimPajama, потом на второй половине SlimPajama + 2 эпохи на датасете StarCoder, и последний 100B Python и web-related data (HTML, JavaScript, CSS) взяты из StarCoder + 10B английского взятого из SlimPajama. Всего CrystalCoder увидела 1.4T. Amber на MMLU показала 30.76 а CrystalCoder 48.78. Хотя казалось бы, Amber обучалась в большей степени на английском и должна больше эту метрику показать. У Llama 2 7B MMLU 45.3. На картинках графики как менялась метрика MMLU для каждой из моделей на протяжении обучения выше. На втором этапе обучения CrystalCoder в датасете было 63% данный кода. Как видно на графике, код никак не мешал росту метрики и уверенный рост начался на втором этапе. На третьем этапе был в основном код и метрика MMLU не упала а даже немного выросла. Huggingface | Github | метрики: 📈 [Amber] 📈 [CrystalCoder] | paper
1 851
13
На код нужно обучать с нуля? DeepSeek AI опубликовал новую версию модели DeepSeek Coder 7B 1.5v и инструктивный вариант на не
На код нужно обучать с нуля? DeepSeek AI опубликовал новую версию модели DeepSeek Coder 7B 1.5v и инструктивный вариант на ней. Это результат дообучения на код модели DeepSeek LLM 7B, которая была обучена на 2T токенов на английский, китайский и немного кода. Дообучали 2T токенов на датасете кода, вероятно, на таком же, как и для других версий моделей для кода. Там было 87% кода и 13% английского и китайского Деталей про модель мало, кроме таблички с замерами в сравнении со старой моделью. Сама модель по метрикам не очень примечательна. Да, у финальной модели метрики по NLP таскам высокие и дообучение на коде их не уронило. Интересно другое, что метрики на код оказались чуть ниже чем у модели, которая видела 2T кода с нуля. Эта модель видела код на первой стадии претрейна, где его было немного и она показывала 26 на humaneval, и потом еще 2T дообучения в основном на коде. Итого 4T токенов и метрики по коду чуть хуже чем у модели, которая 2T обучалась с нуля. 👉 🤗Huggingface
1 973
14
🚀🚀🚀 GigaCode! 🚀🚀🚀 3 года мы шли к этому. Мы начинали еще до появления CoPilot и пейпера Codex. Проделали огромное число
🚀🚀🚀 GigaCode! 🚀🚀🚀 3 года мы шли к этому. Мы начинали еще до появления CoPilot и пейпера Codex. Проделали огромное число экспериментов и обучили много разных моделей. Многое еще предстоит сделать. Распирает гордость за команду! Регистрируйтесь на gigacode.ru и получите доступ первыми. Доступы даем пока дозировано, увеличивая нагрузку. Про наши модели и как работает GigaCode будем рассказывать в будущих постах.
4 170
15
🚀🚀🚀 GigaCode! 🚀🚀🚀 3 года мы шли к этому. Мы начинали еще до появления CoPilot и пейпера Codex. Проделали огромное число экспериментов и обучили много разных моделей. Многое еще предстоит сделать. Распирает гордость за команду! Регистрируйтесь на gigacode.ru и получите доступ первыми. Доступы даем пока дозировано, увеличивая нагрузку. Про наши модели и как работает GigaCode будем рассказывать в будущих постах.
3
16
📊Замеры открытых моделей на RealCode [Github] В первой таблице сравнение моделей на RealCode и HumanEval. В ней и на графике+2
📊Замеры открытых моделей на RealCode [Github] В первой таблице сравнение моделей на RealCode и HumanEval. В ней и на графике для генерации тела функции в RealCode используем только текущий файл, длина контекста 1024 токенов (для infill режима 512 токенов в левом контексте и 512 в правом). Для второй таблицы в контекст подавали и другие файлы текущего проекта (чтобы файлы поместились контекст увеличен до 15к токенов), такая возможность есть только у deepseek-coder. 🔸Pass@1 на RealCode прежде всего зависит от емкости модели Разница между моделями близкой емкости в одинаковом режиме генерации незначительная. На HumanEval же, например, у Starcoder-base-7b Pass@1=28.4, у CodeLlama-7b Pass@1=33.5, а у deepseek-coder-6.7b Pass@1=49.4. Однако, на RealCode рост метрики в LM режиме после 7b параметров незначителен. 🔸Возможность учета правого контекста при генерации важна Мы это связываем с тем, что большинство функций в RealCode это, на самом деле, методы в классах. А в классах можно использовать методы, описанные ниже по тексту. Также при учете правого контекста у модели чаще есть возможность смотреть на использование генерируемой функции. 🔸Потолка качества генерации по 1024 токенам модели не достигают Если взять максимальный Pass@1 для каждой функции по всем замерам на графике (и в LM, и в Infill режимах) и усреднить по всем функциям, то получится Pass@1=0.70. То есть разные модели и разные режимы генерации позволяют правильно генерировать разные функции. 🔸Возможность учитывать весь проект важна Deepseek-coder-1.3b на проектах обыгрывает даже 33b модели. ❗️Модели верно генерируют до 60% функций в реальных репозиториях Конечно стоит учитывать, что в RealCode у моделей при генерации есть заголовок функции и ее докстринг, но показатели все равно кажутся высокими.
2 966
17
🔺 GigaChat Pro. Технические детали Друзья, написали с коллегами небольшую статью про то как обучался GigaChat. Рассказали про оптимизации, про сбор данных и сравнились с другими моделями. Всем, кому интересно обучение LLM, приглашаю почитать. https://habr.com/ru/companies/sberdevices/articles/780334/
1 742
18
📊 Опубликовали бенчмарк RealCode_eval https://github.com/NLP-Core-Team/RealCode_eval RealCode_eval - наш новый бенчмарк по оценке возможностей генерации кода языковыми моделями. Задача для модели состоит в генерации тела для функции (или метода) в реальных репозиториях с гитхаба. Популярные существующие бенчмарки по генерации кода, такие как HumanEval, MBPP или AlphaCode, состоят из задач соревновательного программирования, таких как на LeetCode или CodeForces. RealCode же проверяет модели в условиях реальной разработки. Функции взяты из репозиториев на питоне, опубликованных летом 2023 года. Это означает, что популярные открытые модели Codellama и Starcoder этих репозиториев не видели. Для оценки сгенерированных функций используем execution-based подход: подставляем сгенерированное тело функции в файл, запускаем тесты репозитория и сравниваем количество пройденных тестов между сгенерированным и настоящим телом функции.
4 011
19
🔺 Yi. Новая китайская LLM #ml_news Китайские товарищи выкатили очередную открытую модель, за что им уважение. В этот раз ста
🔺 Yi. Новая китайская LLM #ml_news Китайские товарищи выкатили очередную открытую модель, за что им уважение. В этот раз стартап 01.ai под девизом "Human + AI" (буковка Y в названии символизирует иероглиф 人) обучил на 3T токенах текстов 2 модели — 6B и 34B. Технический репорт обещают показать в следующем месяце. Контекст у выложенных на HF моделей 34k токенов. И сегодня же разработчики должны выложить модели с контекстом в 200k токенов. Качество этих моделей нужно будет ещё замерить на соответствующих long-range метриках, но звучит внушительно. По традиционным метрикам также заявляют рост — 76.3 MMLU у 34B и 63.2 у 6B. Скрипты по дообучению также выложили на GitHub. Посмотрим, как у неё с русским. HF | GitHub
1 124
20
⚡️Deepseek Coder. Новые открытые SOTA модели для кода. Deepseek Coder 1B на равных с CodeLlama 7B, а Deepseek Coder 7B сильне
⚡️Deepseek Coder. Новые открытые SOTA модели для кода. Deepseek Coder 1B на равных с CodeLlama 7B, а Deepseek Coder 7B сильнее CodeLlama 33B. Instruct версия модели 7B на Human Eval сильнее GPT 3.5-turbo. Размеры моделей 1.3B, 5.7B, 6.7B и 33B. Доступны для коммерческого использования. - Архитектура как у Llama, судя по конфигу на HF. - Сет обучения состоял из кода 87% и 13% английского и китайского языка. - Умеет в 80+ языков программирования. - Обучали 2T токенов. К примеру StarCoder обучали 1T токенов. - 16k контекст. Ждем технический отчет. Больше метрик тут deepseekcoder.github.io 👉 Github 👉 🤗Huggingface
1 836