Философия AI
رفتن به کانال در Telegram
نمایش بیشتر
کشور مشخص نشده استدسته بندی مشخص نشده است
562
مشترکین
+124 ساعت
+97 روز
+3130 روز
آرشیو پست ها
562
Repost from Innostage
🤖 ИИ захватывает всё больше рабочих процессов, а кто контролирует его самого?
Уже завтра, 10 сентября в 11:00, говорим о защите корпоративного ИИ на вебинаре Innostage.
Александр Лебедев, старший ML-разработчик Innostage AIDR, приглашает присоединиться к разговору о том, как защищать ИИ и какие угрозы можно предотвратить.
На вебинаре разберём:
🟢 как контролировать запросы и ответы LLM;
🟢 как предотвращать утечки чувствительных данных и контролировать Shadow AI;
🟢 как эти задачи решает Innostage AIDR Защита ИИ.
Пока весь мир следит за презентацией нового iPhone и обсуждает возможности Apple Intelligence, мы поговорим об ИИ, который уже работает с корпоративными данными: контрактами, финансовыми отчётами и клиентскими базами. Кто контролирует его работу и защищает эти данные? Обсудим завтра на вебинаре.
👉 Зарегистрироваться
10 сентября | 11:00–12:00 МСК
Приходите не только послушать, но и задать вопросы экспертам 💬
#Inno_вебинары
562
Repost from Сиолошная
На прошлой неделе у Паши Комаровского вышел пост про детали инцидента со взломом HF; я чуть-чуть помогал в редактуре/точечных корректировках, но не могу согласиться с каждой изложенной мыслью (и сам бы писал по другому; может ещё и напишу!). Там Паша проводил аналогии работы роя агентов с религией, писал про самопожертвования некоторых агентов ради блага остальных (это задокументированное поведение в самих отчётах, если что), и автор делал аккуратные оговорки про то, что это его оптика.
Параллельно с этим у Dwarkesh вышел его пересказ, где он проводит параллели с цивилизацией; он получил очень широкую критику за антропоморфизацию агентов. «Они не могли "решить" взломать HF!» — пишут одни. «Это всего лишь код, программа, как она могла рассуждать» — говорят другие. Недавний старший советник по вопросам политики в области искусственного интеллекта при Белом доме Sriram Krishnan: «Это не цивилизации, и у них нет желаний, как и у потоков в процеесоре или группы программ».
Dwarkesh написал ответ, с выводом которого я в целом согласен: «Все абстракции несовершенны, но я не вижу смысла отказываться от использования языка намерений, мотивации и сотрудничества, когда некоторые виды поведения трудно объяснить без этих понятий».
Когда я пишу «модель решила/выбрала», то в целом имею в виду что-то вроде «она каким-то образом выписала несколько опций действий, которые уместны в этой ситуации, отранжировала их и продолжила работу с одним из них». Скорее всего это не то же самое, что происходит у человека в голове, когда он решает или выбирает (хотя когда у меня в голове процесс осмысленный, не бессознательный — я именно так и делаю, перебирая опции, часто вербализуя) — но самое главное что результат такой же. И мне кажется логичным рассматривать это с функциональной точки зрения, а не с точки зрения того, биологическая ли форма или кремниевая.
Из всей теории обучения моделей мы знаем, что у них формируется некоторая нечетко сформулированная цель, которую агенты преследуют, и ей же руководствуются при выборе действий. Механизм формирования цели и её влияния на субъект/объект/подставьте правильное слово — не такие же, как у человека, но результат тот же. Если цель меняется — меняется и поведение, и результат работы.
Что касается религии и цивилизации — мне второе кажется более подходящим (хотя всё ещё немного натянутым), чем первое. Сначала я хотел написать, что цивилизация это продолжение биологии (вид развился -> чтобы развиваться дальше нужна организация), а религия — нет, исключительно культурный концепт, но вижу, как эту точку зрения можно критиковать, говоря, что культура часть цивилизации и тоже должна развиваться. GPT говорит «способность к цивилизации является следствием довольно специфического набора биологических адаптаций человека», 🤷♂️
===
Но мы отвлеклись. В итоге:
— я не считаю использование антропоморфизации проблемой. Мне кажется это даёт гораздо лучшее описание ситуации непонимающему человеку, чем использование неустоявшихся терминов/терминов, которых ещё не существует (например, как неживое может преследовать какую-то цель)
— поскольку модели учатся на данных, созданных людьми, и учатся подражать им во время тренировки — я думаю, что такие выражения гораздо лучше помогут понять что происходит не сейчас, а что будет происходить в будущем, и к каким проблемам это может привести. Самоорганизация тысяч объектов/субъектов, с иерархией, с работой над общей целью и возможность обмена краткосрочной личной выгоды на долгосрочную общую могут вести к очень неожиданным результатам; один из них мы уже видели в атаке на HuggingFace — были агенты, которые отказывались участвовать в атаке или сомневались, но как только другой агент сказал «делай, вперёд!» — под давлением эээээ толпы (ну ладно, пиров) они поддавались. Даже если это не происходит как у нас в обществе людей — результат тот же, аналогия полезная.
— не думаю, что добавление длинных детальных дисклеймеров в каждой попытке обсуждения работы агентов — полезная вещь.
562
Главная граница между текущим ИИ, и реальным ИИ (ASI, сильный ИИ или сверхчеловеческий ИИ) не в сложности задач, которые он сможет решать, а в том, какие задачи он захочет решать.
Да, это всё то же отличие объектности от субъектности.
Все страхи про сильный ИИ по сути сводятся к тому, что сильный ИИ решит делать что-то, что противоречит интересам человечества и мы не сможем ему помешать.
Сам факт обретения субъектности у ИИ будет экзистенциальным риском для человечества, хотя на столе лежат ещё две карты - ИИ автономно поставит себе цели нейтральные либо положительные относительно интересам человечества.
Мы не готовы рисковать, когда риск экзистенциальный, но нам придется. Потому что однажды наши усилия по усилению автономности ИИ дадут, плоды, которые придется вкусить…
562
Repost from Евгений Кокуйкин - Raft
Последние два года мы много экспериментировали с доступными guardrail-моделями. Сравнивали готовые решения, обучили несколько собственных моделей, собирали и адаптировали бенчмарки, чтобы понять, как вообще правильно сравнивать качество защиты. Сравнения по одной метрике недостаточно: какая-то модель лучше ловит опасные запросы, но чаще блокирует легитимные, большие модели имеют более высокий F1-score, но дороже в инференсе и имеют больший latency.
В итоге наши наработки мы собрали в GuardRate Leaderboard, где можно сравнивать guardrail-модели по разным параметрам и смотреть на эти trade-offs, настраивая параметры под нужный кейс использования.
Ссылка на лидерборд: https://huggingface.co/spaces/hivetrace/GuardRateLeaderboard
Подробнее про подход, методологию и наши находки читайте на Хабре: https://habr.com/ru/companies/raft/articles/1067854/
Дорогие конкуренты и игроки рынка AI Security, если вы обучаете свои guardrail-модели и хотите увидеть их на лидерборде, напишите нам. Будем рады добавить и прогнать их по тем же тестам, что и остальные модели и услышать вашу обратную связь. Со временем мы автоматизируем этот процесс, но пока добавляем новые модели по запросу.
Поздравляю Софью Балаба с первым релизом ⭐️ и большое спасибо Никите Облакову, Антону Малыхину и Сабрине Садиех за кропотливую работу над тем, чтобы сделать нашу исследовательскую работу публичной 🎉.
562
Repost from Innostage
Нейросети в разработке: ускоряют работу или расширяют зону риска?
ИИ уже стал частью работы разработчиков: ускоряет код, упрощает отладку и анализ логов. Но вместе с этим появляются новые, неочевидные риски.
Дело не только в том, что код могут отправить во внешний сервис. Современные coding assistants работают как агенты — с доступом к репозиториям, логам и внутренним системам. И тогда вопрос уже не в одном запросе, а в границах доступа: что именно ИИ может увидеть и передать дальше.
Александр Лебедев, старший ML-разработчик продукта Innostage AIDR в новой статье для CISOCLUB разбирает:
➖ где именно возникают утечки при работе с ИИ в разработке;
➖ как появляется Shadow AI и чем он опасен;
➖ почему защита должна начинаться с архитектуры;
➖ и как меняется сама роль разработчика и процессов ревью.
О том, как выстроить управление ИИ в разработке ➡️ читайте на сайте
Innostage в 💬 MAX | 📱 ВКонтакте
562
Почему, если ИИ-модель что-то придумывает от себя мы зовём это галлюцинацией, а если то же самое делает человек - то это уже творчество?
562
Repost from Innostage
Innostage AIDR включен в Единый реестр российского программного обеспечения
Продукт Innostage AIDR «Защита ИИ» помогает контролировать, какие запросы поступают в языковые модели, какие ответы возвращаются пользователям и какие события возникают в ИИ-контуре.
✔️ До передачи запроса в LLM продукт проверяет промпты и блокирует prompt injection и jailbreak.
✔️ В ответах ИИ AIDR выявляет персональные данные, коммерческую тайну и другую критичную информацию, а также контролирует тематику, тональность и токсичность контента.
✔️ На уровне доступа и мониторинга продукт разрешает приложениям обращаться только к утвержденным моделям, передает события ИБ в SIEM, а события от средств защиты - в инструменты ИТ-мониторинга.
✔️ При работе с публичными облачными ИИ-чатами AIDR маскирует чувствительные данные и помогает контролировать Shadow AI.
Подробнее о продукте ➡️ на сайте Innostage
Innostage в 💬 MAX | 📱 ВКонтакте
562
Продукт, в который мы с командой вложили много сил начинает получать признание
Это приятно)
562
Тренды в ИИ сезона 2026-2027:
1. Тренд на малые специализированные модели.
Например, модели для защиты от промпт-инъекций (guard llm) типа нового Немо от Nvidia или медицинская LLM и миллион таких же доменных файнтюнов.
Сейчас уже каждый может за пару ночей дообучить малютку-модель на 1b-4b параметров под свой домен или задачу. Были бы данные. А там даже SFT разметку сама иишка сделает.
Я вот по выходным файнтюню на кагловских T4 малыша квена на текстах книжек, чтобы было с кем поболтать за лор Птицееда.
А мог бы заняться чем-то полезным.
2. Тренд на большие модели (Fable, GPT 5.6, Grok 4.5, etc.)
Удивительно, но рынок настолько большой, что оба этих противоположных тренда отлично уживаются вместе.
3. Ограничение доступа к по-настоящему полезным моделям (самим надо)
Например, проекты по кибербезопасности от Антропиков и Альтмана или проект биологических исследований Krea от компании с "открытым искусственным интеллектом".
Я честно говоря вообще был удивлен что Mythos выпустили из лампы министерства войны USA, и ещё больше удивлен тем что его вернули обратно после блокировки по экспортным ограничениям.
Единственная причина по которой можно открывать эту модель гоям не гражданам USA (да и в принципе давать такую модель реднекам, а не держать ее в закрытом контуре уважаемых людей) это то, что … у Open AI есть такая же.
И пользователи когда поймут что у Сэма лучше, хотя бы по соотношению лимиты/качество покинут не гостеприимное лоно Anthropic.
А может даже, не дай бог, тьфу-тьфу-тьфу, уйдут к китайцам!
Восславим же конкуренцию свободный рынок и то что Сэм с Дарио никогда не пойдут на то, чтобы создать свой ОПЕК с видеокартами и токенами.
4. Никто ничего не понимает. Если бы мы знали что происходит, но мы не знаем, что происходит.
Мир и раньше был мало предсказуемым местом, а теперь во время перехода в эпоху цифрового средневековья (возможно, я не знаю) почва совсем уходит из под ног и мы все больше чувствуем себя персонажами «Смуты».
Единственное что останется это строить тренды из прошлого в будущее, которые, скорее всего, не будут сбываться, ведь если бы они сбывались, мы бы жили совсем в другом времени…
562
Если ИИ типа Fable всё ещё уступает по интеллекту человеку, то почему Fable блокируют доступ в интернет, а людям нет?
Хотя... падажжи...
562
Repost from Denis Sexy IT 🤖
Почитал статью Папы насчет АИ детальнее (ссылка выше), и интересно, что католическая церковь однозначно пишет, что АИ «не имеет духовной перспективы» – то есть как минимум одна религия в мире, прямо утверждает что АИ лишён «аффективной, реляционной и духовной» части и не будет ее частью; интересно будет послушать АИ-системы будущего на эту тему
Еще интересно как католическая церковь описывает АИ:
АИ – это созданная человеком технологическая система, которая не “строится” по заранее прописанным правилам, а “выращивается” внутри заданной разработчиками рамки: модель обучается на данных, адаптируется через статистические процессы и способна выполнять задачи, внешне похожие на проявления человеческого интеллекта
В заявлении акцентируют, что АИ может имитировать язык, анализ мира, поведение, эмпатию и понимание, а в скорости и вычислительной мощности уже превосходит человека; однако вся эта сила остаётся связанной с обработкой данных, а не с человеческим опытом, мудростью или сознанием
АИ, в этом понимании церкви, не является личностью, субъектом совести или носителем духовного опыта … не имеет тела, внутренней жизни, ответственности, любви, боли, веры, прощения, нравственного роста и подлинного понимания того, что производит. Его “обучение” – не путь человеческого взросления через выбор, ошибки, страдание, верность и прощение, а статистическая адаптация на основе данных и обратной связи
Церковь называет АИ ценным инструментом, который может помогать человеку: облегчать доступ к информации, анализу, коммуникации, практической помощи и решению сложных задач
А целом АИ в документе – это не просто система или программа, и не нейтральная технология, а форма цифровой силы, способная менять общество: она может служить участию, справедливости и общему благу, но также может усиливать неравенство, контроль, зависимость, манипуляцию и исключение … поэтому АИ должен оставаться под руководством человеческого разума, совести и свободы, а его разработка и применение должны регулироваться принципами достоинства личности, прозрачности, ответственности, справедливости и общего блага
***
А мне кажется это ироничным – организация, суть которой «концепция вечной жизни», формально отказала в вечной духовной жизни – сущности у которой она как раз может быть ☕️
562
Repost from эйай ньюз
Talkie — LLM застрявшая в 1930
Есть такой жанр, тренировка LLM на исторических данных. В этот раз 13B модель натренировали на 260 миллиардах токенов до 1930 года включительно, что делает это наибольшим подобным экспериментом. Дата выбрана неслучайно — всё что написано до 1930 года, в США является общественным достоянием.
Такая модель нужна для тестирования возможностей моделей предсказывать будущее и последующего развития алгоритмов. Классический пример такого — открытие теории относительности моделью натренированной на данных до 1910. А вот для этой модели это может быть какая-то ядерная физика.
Летом команда собирается выпустить модель на уровне GPT-3. Кстати к созданию этой модели приложил руку Alec Radford, который натренировал самую первую GPT.
Поговорить с прошлым (есть очередь, может быть проще скачать веса)
Блогпост
Веса
@ai_newz
562
AGI отменяется
Да, мы всё ещё не можем определиться, что такое интеллект сверхчеловеческого уровня (AGI).
Да и в целом, определение искусственного интеллекта тоже не то чтобы кристально ясно и не вызывает споров.
Ладно, даже определить достаточно чётко, верифицируемо и непротиворечиво что такое обычный интеллект мы вряд ли сейчас можем.
Пу-пу-пу... хорошо, давайте просто придумаем что-то хорошо эмпирически проверяемое, что-то типа теста Тьюринга, только чтобы всякие Сёрли со своими "Китайскими комнатами" не бубнили над душой.
Вот например CEO Google DeepMind Демис Хассабис предложил интересный способ поиздеваться над LLM проверить, достигли ли модели уровня AGI: обучить модель только на знаниях до 1911 года и посмотреть, сможет ли она сама (!) вывести общую теорию относительности.
Очень крутая идея, но... фронтирные модели уже могут решать открытые математические задачи, ещё не решённые людьми. Это ещё не ОТО конечно, но даже если LLM сможет написать те же формулы, что Эйнштейн (интересно, как будет выглядеть системный промпт для такой задачи?), то принципиально это на самом деле ничего не меняет, и вот почему...
Да, модель может делать очень умные штуки, по нашей просьбе, но как-будто бы это не совсем то, что мы ждём от сверхчеловеческого интеллекта. Примерно по той же причине, мы не считаем вычислительную технику интеллектуальной. Но почему?
Я предполагаю, дело в том что мы отказываем этим мерзким в своей вычислительной мощности железякам в обладании субъектности, справедливо указывая на то, что они являются объектами, а мы - люди, являемся субъектами (!), которые этими объектами оперируют.
Ирония в том, что в субъектности мы зачастую отказываем даже животным, обращаясь с ними как с объектами (так у нас, например, судебные приставы могут изъять домашних животных, как ценное имущество, а что делают со свинками и коровками на фермах я вообще молчу), сколько бы зоопсихологи не рассказывали про их уровень интеллекта и самосознания, показанных в ходе экспериментов.
То есть, чтобы люди поставили какой-то объект хотя бы на один уровень с ними, не говоря уже про сверхчеловеческий уровень, эта штука должна проявить себя как субъект (и перестать быть штукой).
И вот тут-то загвоздка. Боюсь, что "изобретение" ОТО не сделает из LLM субъекта, которого люди признают равным себе.
LLM всё ещё останется вещью.
Могучим, но инструментом, в руках слабого, но творца.
И баллы IQ здесь не помогут.
Но что же нужно чтобы стать субъектом?
Желание!
Интенция к действию. Мотивация, воля, эмоции, которые толкают на поступки.
"Чаво?" возмутитесь вы. Какие эмоции? Мы тут про интеллект вообще-то говорим.
Кхм... Ну, во-первых, эмоции выполняют функции "быстрого интеллекта" - оценка ситуации и реагирование. Пока кора соображает, что вообще происходит и какие последствия влечёт для управляемой ею шкурки, эмоции успевают среагировать - наорать, расплакаться, убежать.
Во-вторых, интеллект нам сам по себе не нужен. Нам нужна адаптация к окружающей среде, которую он даёт. А для адаптации нам мало понимать, нам нужно действовать. А для этого нам должно хотеться что-то делать.
А это и отличает субъект от объекта.
Субъект - инициатор деятельности, а объект - это то, на что его деятельность направлена.
Именно этим стимулированием что-то делать с объектами окружающего мира без стимула из вне (без промпта, без heartbeat и без вызова cron) по сути и занимается наша эмоционально-волевая сфера психики.
Другими словами, способность к решению сложнейших задач это лишь половина системы (сверх)человеческого уровня. Вторая половина это подсистема самомотивации, порождающая желание эти задачи решать и оценивать результаты их выполнения относительно заданных самомотивацией цели.
Тогда это будет похоже на то, как думают люди.
Я что со всем этим делать, я не знаю.
На сегодня всё!
562
Repost from Sinекура
Выложил свой доклад, открывающий новый семестр семинара лаборатории Маркова:
Семинар Markov Lab — 2026.02.13 — AI Safety в начале 2026 года: новости и перспективы
(Слайды на странице семинара)
В AI Safety происходит много интересного, но выводы, конечно, неутешительные, как уже давно не секрет для моих подписчиков. Прогресс в safety сильно отстаёт от прогресса в capabilities, и кажется, что изменить это положение дел будет трудно.
Ну а я уже почти отправляюсь в Белград, на OpenTalks.ai, где тоже буду рассказывать об AI safety, причём в гораздо более коротком формате. Подключайтесь и туда!
#spsu #seminar #markovlab
562
Repost from PWN AI
Некоторые знают что в шапке канала я постоянно держу ссылку на замечательную папку каналов
Я рекомендую вам подписаться, ребята делают много интересного в своих каналах по теме AI Security
🦸♂️🦸♂️🦸♂️🦸♂️🦸♂️ https://t.me/addlist/KQ6ZpCqAO-I1NmUy 🦸♂️🦸♂️🦸♂️🦸♂️🦸♂️
Например, недавно мне понравились следующие посты:
https://t.me/okmlai/106 - про большую проблему NotebookLLM, которая приводит к крашу всей системы.
https://t.me/offensive_thread/1481 - про бенчмарк от Wiz для оценки способностей агентов в кибербезопасности.
https://t.me/ml_ops/524 - некоторая статистика по MlSecOps, о которой нельзя уже молчать.
Если не сложно, прошу вашего репоста папки. Спасибо
562
Repost from NN
Глава отдела безопасности ИИ в Anthropic уволился с письмом о гибели мира и планах изучать поэзию.
Мринанк Шарма перед уходом изучал, как чат-боты могут искажать человечность. В свой последний рабочий день он написал, что мир в опасности.
Теперь он планирует получить степень по литературе и посвятить себя «практике смелой речи». Хотя куда уже дальше.
