Field-to-Field
Open in Telegram
Вычислительные подходы, искусственный интеллект, пост-человек, генеративная эстетика, мета-вселенные. Смешиваю архитектуру, дизайн и искусство, простое и сложное, теоретическое и практическое. Об.св @eduardhaiman
Show more768
Subscribers
No data24 hours
No data7 days
-130 days
Posts Archive
📖 В открытом доступе появилась книга "Architectural Intelligence in the Age of Artificial Intelligence"
1/2
Это сборник, в котором архитекторы, философы и исследователи анализируют, как ИИ влияет на дисциплину. Структура книги построена в четыре части. В первой формулируются различия между человеческим и машинным интеллектом: от философских размышлений о креативности (Дитер Мерш, Кристиан Георг Мартин) до анализа того, как физическое присутствие делает человеческое мышление уникальным. Во второй части — интервью: историк Марио Карпо сравнивает работу ИИ с классической традицией копирования, а художник Филипп Шаэрер показывает, что без идеи и концепции автора алгоритмы остаются пустыми инструментами.
+1
4/4
Исследование показало, что RL-агенты позволили архитекторам обнаружить неожиданные эффекты проектных решений — «слепые зоны», коллизии, узкие проходы — и увидеть пространство глазами ребёнка. Это помогло уйти от взрослого стандартизированного подхода и сместить внимание к детскому восприятию среды.
Хотя у метода есть ограничения (небольшая выборка, отсутствие проверки в реальных условиях, игнорирование таких факторов как свет и цвет, чтоб может быть существенным для реалистичной имитации детского поведения) исследование кажется является первым примером применения RL-агентов для генерации динамических игровых поведений в архитектурной практике. Оно показало, что такие симуляции могут стать инструментом для более осознанного и человеко- (дето-) центренного проектирования.
3/4
Это позволило исследователям не просто воспроизводить стандартные движения, а моделировать непредсказуемые и живые реакции детей на архитектурные элементы и поведение других участников.
Затем провели эксперимент: 14 архитекторов (опытные и начинающие) решали задачу проектирования дошкольного пространства сначала традиционными методами, а затем с использованием RL-модели.
Оказалось, что эксперты после симуляции добавляли новые цели (например, стимулирование социального взаимодействия), упрощали и оптимизировали планировочные решения.
Новички же, напротив, изначально выдвигали амбициозные, но размытые идеи, а симуляция сместила их внимание на вопросы безопасности и практической организации пространства.
2/4
Для этого они построили полноценную симуляцию в Unity 3D, подключив ML-Agents Toolkit и алгоритм обучения с подкреплением PPO. Внутри неё были созданы виртуальные «дети»-агенты в возрасте 3–6 лет, каждый из которых обладал параметрами физического развития (сила, скорость, моторика, координация) и социальными характеристиками (зрение, способность реагировать на других агентов, склонность к совместной игре).
Агент учился двигаться и взаимодействовать с окружением не по заранее заданным траекториям, а методом проб и ошибок, постепенно осваивая разные типы поведения. В результате в симуляции появлялись реалистичные игровые сценарии: ходьба по поверхности с разными уклонами, лазание по наклонным конструкциям, скольжение и ползание, а также социальные формы взаимодействия — от параллельной игры и имитации действий сверстников до кооперативных игр с мячом или совместного сидения и наблюдения.
RL-агенты имитирующие поведение детей для проектирования игровой среды 1/4
Некоторое время назад наткнулся на исследование c довольно необычном применение обучения с подкрепления для усиления архитектурного проектирования, в частности детской игровой среды. Исследователи из Университета Инха в Южной Кореи разработали модель игровых поведений детей с помощью агентов на основе обучения с подкреплением (RL).
А затем они изучали как такие агенты влияют на процесс проектирования архитекторов, особенно в части компромиссов между требованиями: физическое развитие, социальные взаимодействия и безопасность.
Их задача была понять как использование RL-агентов помогает архитекторам вырабатывать новые проектные цели, корректировать стратегии и оптимизировать планировочные решения.
+1
Один показательный пример задач циркуляции — исследование где планирование дорог в трущобах рассматривается как задачу последовательного принятия решений. Вместо классических эвристик они используют глубокое обучение с подкреплением и графовые нейросети (GNN сейчас на пике моды). Модель шаг за шагом «прокладывает» новые дороги, чтобы:
- повысить связанность районов,
- сократить время и дистанцию перемещений,
- минимизировать строительные затраты.
Результаты показали, что такой подход улучшает на 10-20% доступность по сравнению с существующими методами, причём модель может использоваться на разных городских масштабами.
Таким образом, от простых экспериментов в духе Пакмана и двух акторов на графе можно прийти к задачам, которые напрямую влияют на качество жизни людей.
Circulation, Routing и RL в реальных задачах
Задача с двумя акторами на графе — это пример более общей категории задач circulation или routing: организация движения по неоднородной сети с ограничениями. Подобные постановки широко встречаются в транспортных системах, логистике и конечно в городском планировании.
Сегодня многие исследования применяют RL для:
- поиска и оценки оптимальных маршрутов,
- балансировки между разными целями (скорость, стоимость, безопасность),
- и конечно для оптимизации процесса принятия дизайн-решений в архитектуре и урбанистике.
Хореография на графе: усложнённый Q-learning
Следующим шагом я попробовал более сложную задачу — оптимизацию путей на графе. Теперь агенту нужно было управлять сразу двумя акторами — красным и синим. Они стартуют из случайных позиций (отмечены кругами) и должны прийти к выходу (центральный узел графа).
Условия задачи сделали её гораздо интереснее:
- акторы не могут находиться одновременно в одной вершине,
- разные рёбра графа приносят разные вознаграждения,
- за промедление по-прежнему полагается штраф,
- есть запретные ходы, исключающие столкновения.
Здесь среда стала на порядок сложнее.
Теперь состояние (state) описывает позиции двух акторов сразу, и пространство состояний заранее не известно. Действия тоже не ограничивается простыми «влево/вправо/вверх/вниз» — оно зависит от текущей структуры графа.
В итоге алгоритм должен был учиться находить согласованную стратегию для двух агентов одновременно, балансируя между кратчайшими путями, вознаграждениями рёбер и ограничениями на совместные ходы.
Q-learning
Q-learning — самый простой алгоритм, который можно реализовать на чистом Python без специальных библиотек. Он помогает на практике понять ключевые элементы:
state — состояние среды,
action — возможные действия агента,
transition — переходы и результат этих действий,
а также саму идею Q-таблицы, где агент хранит «ценность» действий в разных состояниях.
Мой первый эксперимент был простой задачкой вроде Пакмана: агент должен был найти оптимальный путь, где одновременно есть поощрение за сбор «вкусняшек» и штраф за слишком длинный маршрут. Постепенно агент учился находить баланс между кратчайшей дорогой и максимальными наградами.
Тут «ручками» прописывалось уравнение Беллмана, которое лежит в основе обучения с подкреплением. В нем базовую идея: ценность текущего действия зависит не только от награды сейчас, но и от ожидаемых будущих наград.
Q-learning наглядный: видишь как агент пробует разные варианты, запоминает результат и шаг за шагом улучшает стратегию.
Плюсы и минусы model-free и model-based подходов
У каждого из двух подходов есть свои выгоды и издержки. Как и в архитектурной практике: иногда мы идём по пути быстрых экспериментов, иногда — строим сложные симуляции.
Model-free — сила простоты
➕ Плюсы:
- Простота: не нужно заранее описывать законы среды или пытаться встроить их в вычислительную модель.
- Универсальность: работает там, где сама среда настолько сложна, что её невозможно точно смоделировать.
- Лёгкость прототипирования: можно быстро запускать эксперименты и проверять идеи.
➖Минусы:
- Долгое обучение: агент учится медленно, методом множества проб и ошибок.
- Ошибки стоят дорого: агент может делать много неудачных шагов, прежде чем выработает успешную стратегию.
📌 Именно эти плюсы во многом предопределили мой выбор PPO в своём исследовании. Этот алгоритм хорошо подходит для прототипирования: можно строить среду и сразу запускать обучение, не задумываясь, как аккуратно переносить её законы в отдельную модель. Хотя минусы тоже на лицо — алгоритм может учиться многие часы.
Model-based — сила предсказаний
➕ Плюсы:
- Сложность: нужно построить модель среды, а это трудоёмко и не всегда возможно.
- Хотя существуют алгоритмы, где модель учится автоматически из данных, это тоже требует ресурсов и не гарантирует точности.
- Риск ошибок: если модель неточна, агент будет уверенно действовать «не туда».
➖Минусы:
- Сложность: нужно построить модель среды или прикрутить , а это трудоёмко и не всегда возможно.
- Риск ошибок: если модель неточна, агент будет уверенно действовать «не туда».
📐 Для архитекторов это похоже на работу с тем же Kangaroo Physics: ты можешь сразу просматривать сценарии и принимать решения осознанно, но перед этим нужно вложиться в построение модели, а ошибки симулятора могут ввести в заблуждение.
🤝Подходы можно комбинировать: использовать простоту model-free, чтобы набрать базовый опыт, и когда стабилизировалась понимание среды, то можно перейти к model-based для точности, ускорения финального обучение и улучшения планирования.
Model-based — учиться «по плану»
Другой стажёр знает немного физику и использует Grasshopper + Kangaroo Physics. Он может симулировать поведение стержней, заранее просматривать последствия шагов и планировать сборку. В терминах RL это означает, что агент учит модель среды — функцию, которая на основе текущего состояния и выбранного действия предполагает следующее состояние и награду. Эта функция позволяет предсказывать и планировать возможные успешные действия и тем самым помогает выбрать текущее.
Примеры:
Dyna-Q — один из первых гибридных алгоритмов: агент одновременно учится на опыте и планирует на основе выученной модели переходов.
PETS (Probabilistic Ensembles with Trajectory Sampling) — использует ансамбль вероятностных моделей динамики, чтобы учитывать неопределённость и лучше предсказывать будущее.
MBPO (Model-Based Policy Optimization) — комбинирует короткие симулированные траектории с реальными данными, чтобы избежать накопления ошибок модели.
Dreamer / DreamerV2 — учится в «латентном пространстве» внутренней мировой модели и действует, воображая будущие сценарии, не взаимодействуя напрямую с внешней средой.
MuZero — алгоритм DeepMind, который научился играть в шахматы, го и Atari, не зная заранее правил: он сам строит модель переходов и наград из опыта.
Model-free — учиться «на лету»
Представьте архитектора-стажёра, который строит из палочек мост методом проб и ошибок. Конструкция падает — за это он получает «нагоняй». Конструкция устояла — за это его хвалят. Чем дальше он продвинулся, тем выше суммарная похвала. Так шаг за шагом он меняет схему, добавляет стяжки и постепенно накапливает опыт. У него нет внутренней модели физики, он просто учится на последствиях собственных действий. Технически это означает, что алгоритм напрямую учит политику (как действовать) и/или ценность (насколько хороша ситуация), опираясь лишь на историю взаимодействий.
Примеры:
Q-learning — самый простой и классический алгоритм, которым можно «на коленке» показать, как работает обучение с подкреплением. Хорош для понимания базовой идеи.
DQN (Deep Q-Network) — расширение Q-learning, где для оценки действий используется нейросеть. Стал известен благодаря играм Atari: агент учился играть только глядя на пиксели.
PPO (Proximal Policy Optimization) — популярный и надёжный алгоритм из семейства policy gradient. Работает как с дискретными, так и с непрерывными действиями.
DDPG (Deep Deterministic Policy Gradient) — алгоритм для непрерывных пространств действий. Часто применяется в робототехнике, где нужно управлять реальными движениями.
SAC (Soft Actor-Critic) и TD3 (Twin Delayed DDPG) — более современные варианты, которые добавляют устойчивость и эффективность в задачах с непрерывным управлением.
Model-free vs. model-based RL
Обучение с подкреплением (RL) — это когда агент (как архитектор-стажёр в мастерской) в каждом состоянии делает действие и получает вознаграждение. Его цель — научиться стратегии действий, дающей наилучший суммарный результат. В предыдущем посте я упоминал о RL, который использую, но не уточнил, что это именно model-free. Однако внутри RL есть два основных подхода — model-free и model-based, о которых подробнее далее. А пример с архитектором надеюсь поможет.
Реклама.
Нейросети — главный апгрейд архитектора в 2025
Специалисты, которые уже используют AI, создают по 3–4 концепта в день и сводят к минимуму рутину — а значит, экономят ресурсы и освобождают время для креативных задач.
Хотите так же?
На курсе «AI в архитектуре: от идеи до концепта» от STEMPS вы узнаете, как создавать больше, тратить меньше времени и быть на голову выше конкурентов.
Вы научитесь:
– Быстро создавать визуальные прототипы и концепты
– Писать точные промты и адаптировать их под свои задачи
– Работать в Midjourney, Stable Diffusion, ChatGPT
– Использовать нейросети на ежедневной основе
Автор курса — Николай Фанеев, руководитель проектных групп в бюро IND.
В его портфолио — инновационная школа в Дубае? комплекс апартаментов «Большевик», студенческий кампус в Бурабае.
Старт потока — 12 августа
Три бесплатных урока на сайте
— Скидка 10% до 5 августа
— Удостоверение о повышении квалификации
Успейте присоединиться со скидкой:
https://stemps.ru/
Реклама.
Нейросети — главный апгрейд архитектора в 2025
Специалисты, которые уже используют AI, создают по 3–4 концепта в день и сводят к минимуму рутину — а значит, экономят ресурсы и освобождают время для креативных задач.
Хотите так же?
На курсе «AI в архитектуре: от идеи до концепта» от STEMPS вы узнаете, как создавать больше, тратить меньше времени и быть на голову выше конкурентов.
Вы научитесь:
– Быстро создавать визуальные прототипы и концепты
– Писать точные промты и адаптировать их под свои задачи
– Работать в Midjourney, Stable Diffusion, ChatGPT
– Использовать нейросети на ежедневной основе
Автор курса — Николай Фанеев, руководитель проектных групп в бюро IND.
В его портфолио — инновационная школа в Дубае? комплекс апартаментов «Большевик», студенческий кампус в Бурабае.
Старт потока — 12 августа
Три бесплатных урока на сайте
— Скидка 10% до 5 августа
— Удостоверение о повышении квалификации
Успейте присоединиться со скидкой:
https://stemps.ru/
Я много раз упоминал что в своём исследовании я применяю обучение с подкреплением (Reinforcement Learning) для оптимизации распределения пространства и персонала в зданиях где важно расписание и планирование, таких как клиники. Цель — находить стратегии, которые адаптируются к изменяющемуся спросу и позволяют балансировать между операционной эффективностью, удобством для пользователей (например, сокращение расстояний для пациентов) и уплотнение использования пространства во времени. Но я как-то упускал рассказать, а что под капотом.
А использую я алгоритм Proximal Policy Optimization (PPO) из библиотеки Stable-Baselines3 (SB3). PPO — это on-policy алгоритм, основанный на архитектуре actor-critic, который сочетает обучение стратегии (policy) и оценочной функции (value function). Его ключевая особенность — ограниченное обновление стратегии (через кллипинг или доверительный регион), что обеспечивает стабильность и предотвращает разрушение уже обученной политики.
Что значит on-policy? Это означает, что алгоритм обучается исключительно на тех действиях, которые сам совершает в процессе взаимодействия с окружением. Это противоположно off-policy алгоритмам, которые могут использовать данные, полученные от других стратегий. On-policy подход делает обучение более стабильным, но обычно требует больше данных.
Кроме того, я использую расширение Maskable PPO, которое позволяет маскировать недопустимые действия в конкретных состояниях среды — это критично для задач, где не все действия допустимы всегда, как в планировании расписаний и распределении ресурсов.
Используемые библиотеки:
🧠 SB3: https://github.com/DLR-RM/stable-baselines3
🛠 SB3-Contrib (Maskable PPO): https://github.com/Stable-Baselines-Team/stable-baselines3-contrib
Philosophy and Simulation: The Emergence of Synthetic Reason (Manuel DeLanda) — раскрывает, как компьютерные симуляции формируют «синтетический разум», соединяя философию науки, теорию сложности и искусственную жизнь.
Building Performance Simulation for Design and Operation (ред. Jan L. M. Hensen & Roberto Lamberts) — всеобъемлющее руководство по моделированию энергопотребления, комфорта и устойчивости зданий на этапах проектирования и эксплуатации.
Co-Designers: Cultures of Computer Simulation in Architecture (Yanni Alexander Loukissas) — этнографический взгляд на то, как симуляционные инструменты меняют коллективную практику архитекторов и принятие проектных решений.
И как говорится last but not least, блок про симуляцию, что является ключом к пониманию и проектированию сложных систем. Эти три книги раскрывают её философские корни, прикладные методики и культурные последствия.
Climatic Architecture (Philippe Rahm) — рассматривает здание как «климатическую машину», где форма и материал подчинены управлению теплом, светом и воздухом.
Adaptive Sensory Environments: An Introduction (Maria Lorena Lehman) — объясняет, как динамически настраивать свет, звук и визуальные стимулы, превращая пространство в чувствительную среду.
Cybernetics and the Constructed Environment (Zhao Zhang) — переосмысливает кибернетику, показывая, как архитектура может стать посредником между природными системами и цифровыми технологиями.
Architecture and Interaction: Human–Computer Interaction in Space and Place (ред. Dalton et al.) — объединяет HCI и архитектуру, раскрывая, как интерфейсы и сенсоры превращают пространство в интерактивный опыт.
Interactive Architecture: Adaptive World (ред. Michael Fox) — демонстрирует проекты, где конструкции изменяют конфигурацию в реальном времени, реагируя на людей и окружение.
Adaptive Architecture: Changing Parameters and Practice (ред. Preiser, Hardy & Wilhelm) — исследует методы проектирования и эксплуатации зданий, способных эволюционировать вместе с меняющимися климатическими и социальными требованиями.
А вот этот эти шесть книг о том, как архитектура перестаёт быть статичной, как здания могут чувствовать, думать и приспосабливаться к климату, пользователям и технологиям.
