Максим Котёнков: SEO и AI-автоматизация
رفتن به کانال در Telegram
Продвигаю бизнес, пишу об этом. Консультирую. Чат канала https://t.me/+wa_MnXYlz3M1NTNi Связаться со мной: @ceoresultup Цены, услуги: https://resultup.agency/ Мой курс https://seomeat.ru ИП Котенков М.Е., ИНН 132000766190
نمایش بیشتر7 286
مشترکین
اطلاعاتی وجود ندارد24 ساعت
+47 روز
+1630 روز
در حال بارگیری داده...
کانالهای مشابه
ابر برچسبها
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
سپتامبر '26
سپتامبر '26
+9
در 0 کانالها
اوت '26
+95
در 3 کانالها
Get PRO
ژوئیه '26
+109
در 1 کانالها
Get PRO
ژوئن '26
+103
در 1 کانالها
Get PRO
مه '26
+225
در 3 کانالها
Get PRO
آوریل '26
+142
در 2 کانالها
Get PRO
مارس '26
+151
در 4 کانالها
Get PRO
فوریه '26
+164
در 4 کانالها
Get PRO
ژانویه '26
+138
در 4 کانالها
Get PRO
دسامبر '25
+173
در 4 کانالها
Get PRO
نوامبر '25
+122
در 2 کانالها
Get PRO
اکتبر '25
+174
در 3 کانالها
Get PRO
سپتامبر '25
+183
در 3 کانالها
Get PRO
اوت '25
+317
در 4 کانالها
Get PRO
ژوئیه '25
+188
در 5 کانالها
Get PRO
ژوئن '25
+163
در 4 کانالها
Get PRO
مه '25
+243
در 3 کانالها
Get PRO
آوریل '25
+324
در 6 کانالها
Get PRO
مارس '25
+199
در 3 کانالها
Get PRO
فوریه '25
+188
در 1 کانالها
Get PRO
ژانویه '25
+190
در 2 کانالها
Get PRO
دسامبر '24
+204
در 1 کانالها
Get PRO
نوامبر '24
+197
در 2 کانالها
Get PRO
اکتبر '24
+305
در 2 کانالها
Get PRO
سپتامبر '24
+324
در 1 کانالها
Get PRO
اوت '24
+150
در 2 کانالها
Get PRO
ژوئیه '24
+147
در 1 کانالها
Get PRO
ژوئن '24
+231
در 1 کانالها
Get PRO
مه '24
+155
در 2 کانالها
Get PRO
آوریل '24
+254
در 4 کانالها
Get PRO
مارس '24
+124
در 1 کانالها
Get PRO
فوریه '24
+160
در 1 کانالها
Get PRO
ژانویه '24
+212
در 2 کانالها
Get PRO
دسامبر '23
+225
در 5 کانالها
Get PRO
نوامبر '23
+132
در 2 کانالها
Get PRO
اکتبر '23
+205
در 2 کانالها
Get PRO
سپتامبر '23
+218
در 0 کانالها
Get PRO
اوت '23
+520
در 0 کانالها
Get PRO
ژوئیه '23
+97
در 0 کانالها
Get PRO
ژوئن '23
+375
در 0 کانالها
Get PRO
مه '23
+272
در 0 کانالها
Get PRO
آوریل '23
+152
در 0 کانالها
Get PRO
مارس '23
+146
در 0 کانالها
Get PRO
فوریه '23
+189
در 0 کانالها
Get PRO
ژانویه '23
+199
در 0 کانالها
Get PRO
دسامبر '22
+142
در 0 کانالها
Get PRO
نوامبر '22
+195
در 0 کانالها
Get PRO
اکتبر '22
+122
در 0 کانالها
Get PRO
سپتامبر '22
+133
در 0 کانالها
Get PRO
اوت '22
+177
در 0 کانالها
Get PRO
ژوئیه '22
+122
در 0 کانالها
Get PRO
ژوئن '22
+333
در 0 کانالها
Get PRO
مه '22
+182
در 0 کانالها
Get PRO
آوریل '22
+81
در 0 کانالها
Get PRO
مارس '22
+43
در 0 کانالها
Get PRO
فوریه '22
+23
در 0 کانالها
Get PRO
ژانویه '22
+556
در 0 کانالها
| تاریخ | رشد مشترکین | اشارات | کانالها | |
| 04 سپتامبر | +2 | |||
| 03 سپتامبر | +1 | |||
| 02 سپتامبر | +3 | |||
| 01 سپتامبر | +3 |
پستهای کانال
| 2 | بدون متن... | 1 705 |
| 3 | بدون متن... | 1 915 |
| 4 | Хочу начать новую ветку постов про исследования текстового анализа.
Но хочу предварительно понять чем сейчас живет рынок SEO. | 2 073 |
| 5 | Агент "GEO Монстр" — самый мясной агент, что выходил в школе
Это полноценная рабочий GEO-фреймворк, который изучает бизнес, измеряет видимость в поиске и AI, формирует контент-план, создает материалы и отслеживает результат.
Агент в цифрах
31 специализированный скилл
69 локальных Python-инструментов
27 пользовательских команд
14 аналитических экранов
10 этапов полного рабочего цикла
7 аналитических контуров: AEO, GEO, бренды, тональность, репутация, QFO, URL/домены
4 формата генерации контента: статьи, коммерческие страницы, рейтинги, внешние публикации
3 интеграции сбора: DataForSEO, XMLRiver, Firecrawl
2 типа технического аудита: доменный и one-page
4 поддерживаемые среды: Codex, Claude Code, Cursor, Antigravity
27 структурированных схем данных
Как работает агент
Сначала агент знакомится с проектом:
ㆍ исследует сайт, продукты, услуги и посадочные страницы;
ㆍ фиксирует УТП, ограничения, целевые действия и варианты написания бренда;
ㆍ собирает факты, кейсы и отзывы в базу знаний;
ㆍ разделяет семантику на темы, кластеры, запросы и страницы.
Затем предлагает последовательный план и самостоятельно ведет пользователя по этапам.
AEO- и GEO-замеры
Через DataForSEO и XMLRiver агент:
ㆍ собирает SERP в Google и Яндексе;
ㆍ определяет наличие AI-ответов, сохраняет их тексты и источники;
ㆍ проверяет позиции, упоминания бренда и цитирование URL;
ㆍ находит расхождения между целевой, ранжируемой и цитируемой страницей;
ㆍ поддерживает разные страны, города, языки и поисковые системы.
Для GEO агент создает живые пользовательские промты с учетом аудитории, этапа выбора, географии и реальных сценариев использования продукта. Отдельная проверка удаляет дубли, искусственные и нереалистичные формулировки.
Живые замеры выполняются через DataForSEO ChatGPT Advanced с force_web_search. Сохраняются ответы, источники, упоминания бренда, цитируемые URL и fan-out-запросы.
Перед платным запуском агент показывает параметры, рассчитывает бюджет по актуальным тарифам и запрашивает подтверждение. Длительные процессы сохраняются по ходу выполнения и продолжаются с точки остановки.
Аналитика и контент-план
AEO- и GEO-данные можно анализировать отдельно или объединять:
ㆍ динамика позиций и AI-цитирования;
ㆍ наиболее цитируемые страницы, домены и бренды;
ㆍ тональность и негативные аспекты упоминаний;
ㆍ QFO- и fan-out-темы;
ㆍ устойчивость результатов между замерами;
ㆍ репутационные запросы и страницы.
На основе данных агент формирует контент-план: кластеры, хабы, типы страниц, коммерческий потенциал, приоритеты, статусы ТЗ и публикаций, даты обновлений и повторных замеров.
ТЗ и создание контента
В систему встроены отдельные контуры для:
ㆍ коммерческих страниц;
ㆍ информационных статей;
ㆍ рейтингов и подборок;
ㆍ внешних публикаций.
Агент может использовать готовое ТЗ из SEO Meat или собрать его самостоятельно по семантике, SERP, AI-ответам и конкурентам.
Для статей применяется многосторонний STORM-ресерч. Для коммерческих страниц отдельно анализируются продукт, аудитория, сценарии конверсии и доказательства. Готовые материалы проходят редактуру, хуманизацию и проверку ТЗ.
Внешние размещения
Агент находит цитируемые каталоги, рейтинги, подборки и обсуждения, проверяет возможность добавить компанию, исследует Reddit, Quora и другие сообщества. Каждое размещение связывается с продуктом и задачей пользователя, после чего отслеживаются индексация, позиции и AI-цитирование.
Аудиты и дашборд
В систему входят доменный, технический и one-page аудиты, проверка доступности для поисковых и AI-ботов, сохранение скриншотов и доказательств, история запусков и повторных проверок.
Все результаты доступны в светлом аналитическом дашборде.
▪️ Начать внедрять агента: https://seomeat.ru/price/ — доступ к скачиванию агента и урокам открывается в рамках единой оплаты доступа к платформе SEO Мясо. Уроки по агенту выходят в рамках курса по GEO и AEO продвижению (модуль 9).
▪️ Агент будет вам доступен и после окончания доступа к школе так как я передаю вам по сути его код. | 1 500 |
| 6 | Большое видео по GEO и AEO продвижению без воздуханства, сущностей, разметок https://www.youtube.com/watch?v=wBMAATs2Yc0
Это самое токсичное и практичное видео у меня на канале. Видео вышло пару часов назад, а кто-то уже попытался накрутить дизлайков.
Кого я задену этим видео:
1. Воздуханов продающих GEO за 120к с набором работ на 1 день работы джуна.
2. GEO-экспертов, которые в качестве источников для материала выступления на конфе указывают телеграм каналы других челов, которые разбираем там исследования Ахрефса.
3. Создателей GEO-инструментов, которые продают парсинг чатов за дичайший оверпрайс. Типа мониторинга 1000 промтов раз в неделю -> 1млн рублей, когда это стоит тыщ 5 от силы.
4. И мамкиных вайбкодеров создателей агентов. Так как агента из видео я отдаю вам бесплатно, а не пытаюсь его продать.
К концу видео:
1. У вас будет понимание, что реально работает в GEO, а где вам впаривают херню. Ну это я в целом тут на канале хорошо разобрал.
2. Получите GEO-агента для Claude Code, Codex и пр., с помощью которого можно пройти основной контур по GEO.
2. Почему не нужно покупать сервисы GEO-аналитики за оверпрайс и как сделать свой дашборд в 100 раз дешевле за пару часов.
3. Посмотрим КП от GEO-воздуханов за 120к рублей, которое по факту делается за 3-4 часа и 100 рублей в моем GEO-агенте, что я вам дам.
❤️ Буду признателен за лайк и комментарий под видео
00:00 - Что будет в курсе и как работает GEO-агент
03:10 - Итоговый дашборд аналитики
06:00 - Почему большинство советов по GEO не работает
07:22 - Установка агента и структура проекта
12:25 - Первый запуск и настройка разрешений
17:40 - Сбор информации о бренде и сайте
18:00 - Нужен ли GEO-трафик и умерло ли классическое SEO
20:30 - Цитирование сайта и упоминание бренда — в чём разница
21:07 - GEO и AEO: основные понятия
21:32 - Как нейросети формируют ответы
24:11 - Fan-out-запросы, поиск источников и работа с чанками
28:00 - Главный фактор цитирования в AI-ответах
30:00 - Какие поисковые системы использует ChatGPT
33:00 - Как работает поисковый слой нейросетей
35:00 - Индексация сайта и доступность для AI-ботов
36:00 - Аудит доступности сайта с помощью агента
39:00 - Как проверить блокировки AI-ботов
42:00 - Мониторинг визитов нейросетевых ботов
44:00 - Главное отличие GEO от классического SEO
47:14 - Подключение API для анализа AI-выдачи
50:09 - Запуск сбора семантики и создание контент-плана
51:00 - Как агент анализирует Google и Яндекс
54:00 - Как подобрать реальные пользовательские промты
57:21 - Где брать промты и запросы для ChatGPT
1:00:15 - Создание технического задания с помощью агента
1:03:00 - Как связать продукт с интентом пользователя
1:06:21 - Точки входа для продвижения бренда
1:09:00 - Как находить площадки, которые реально цитируются
1:12:00 - Размещения на внешних площадках
1:13:00 - Продвижение материалов по конкретным запросам
1:15:50 - Как оценивать эффективность GEO
1:18:13 - Создание собственного мониторинга видимости
1:21:25 - Дашборд GEO-аналитики с помощью агента
1:24:00 - Главные ошибки GEO-продвижения
1:27:00 - Разбор коммерческого предложения GEO-агентства
1:30:00 - Сколько на самом деле может стоить GEO-продвижение
1:32:00 - Итоги и финальная схема работы | 2 437 |
| 7 | Еще немного на подумать на счет индекса ChatGPT
Я провел небольшой эксперимент, где:
1. Закрыл от LLM ботов (на уровне IP) и всех поисковых систем кроме Яндекс и Google сайт ResultUP
2. Переименовал один из разделов из "blog" в "articles"
3. Отправил 6 статей на индексацию в Google (те что на фото)
4. Подождал их индексации
5. Открыл сайт для Chatgpt ботов
6. Сделал запрос в ChatGPT web-поиск url адресов с сайта на новых адресах
7. И получил блять ровно те 6 URL что я переиндексировал в Google в первую очередь, потому-что лимит у сайта на отправку 6 url максимум и я шел ровно по порядку выкладки статей в блоге https://skr.sh/scFfYOPVtFn
8. Потом отправил проиндексировать в Google 1 случайных материал и после индексации в Google ChatGPT тоже начал его видеть.
Но возможно это опять какая-то случайность, как тут и тут. | 2 450 |
| 8 | По опросу уже примерно понятна общая картина.
Мой вывод простой: Codex сейчас реально хорош. Он уже нормально конкурирует с Claude Code, а в некоторых задачах даже его обходит.
Весь июнь я параллельно использовал и Codex, и Claude Code для разных задач. По моим ощущениям, Claude заметно лучше в генерации контента и фронтенде. Особенно в дизайне — там разница действительно ощутимая, и для многих это может быть решающим преимуществом. Но для этих задач мне проще по API вызвать модель Claude.
Но это не значит, что теперь всем нужно срочно бросать Claude Code и переходить на Codex, потому что он оказался на хайпе.
Главная проблема в другом
Вокруг Claude Code сформировалось какое-то сектантское мышление. Часть людей просто не хочет замечать, что существуют другие нормальные инструменты подходящие под их задачи.
Работайте там, где вам удобно и где вы получаете результат. Не нужно превращать один инструмент в культ и рассказывать всем вокруг, что они лохи, потому что выбрали что-то другое.
И да, мне похуй на реакции и возможные обиды: люди, которые хуесосят других за использование Claude Code, ничем не лучше тех, кто хуесосит людей за то, что они Claude Code не используют. Одни строят из себя сраных умных, а другие сектанты.
Нужно уметь выбирать инструмент под свои задачи и видеть альтернативы. | 2 142 |
| 9 | Claude Code vs другие IDE и харнесы. Давайте составим картину рынка. | 1 978 |
| 10 | 8 причин попробовать Codex вместо Claude Code
Я сам немного поучаствовал в хайпе вокруг Claude Code. Но Codex очень хорошо обновился, и последние два с половиной месяца использую теперь только его для своих задач.
А сегодня еще вышла новая линейка моделей 5.6.
Вот причины:
1. По ощущениям он точнее, совершает меньше ошибок.
2. Лимитами можно обмазываться, их постоянно сбрасывают. Ультра-режим на высокой скорости вообще не выключаю на подписке за 200 баксов.
3. Комфортное управление с мобильника. Я не выключаю ПК, и когда мне приходит какая-то идея вне дома или мне становится скучно, то я начинаю работать с Codex через чат на мобильном.
4. Режим /goal — пушка, но его нужно активировать в конфиге. Низкая автономность Codex ранее была преградой для меня.
5. Лояльно относятся к российским IP. Спокойно юзаю на своем ПК Codex. Один раз забанили аккаунт, но потом разбанили и дали промокод на 1 месяц бесплатного PRO. Claude в этом плане контора пидорасов.
6. Субагенты — тоже есть, но надо просить их вызывать, если вам прямо надо. Вызывает 6 штук параллельно.
7. Нет возни с получением доступа к ТОП-моделям через подтверждение документов. Тут конечно поживем увидим.
8. Новая модель ChatGPT 5.6 Sol близка к Fable по качеству работы, но шустрее и дешевле. | 2 240 |
| 11 | Упс, кажется кто-то спалился 🤭
Немного для общей образованности. Когда ChatGPT нужно найти что-то на конкретно сайте в поиске, то он может делать запрос вида "site:site.ru запрос". И по всей видимости эти запросы могут направляться в Google.
Ставлю небольшой эксперимент. Потом покажу результаты, пока идет как и задумывалось. | 2 933 |
| 12 | Доброе утро, GEO-шники! Графики на подумать. На них показана вероятность попадания доменов и их URL в слои цитирования и поиска ChatGPT по коммерческим запросам на 5 языках и в 5 странах — в зависимости от их позиции в Google, если домен или URL встретились по одному и тому же запросу в Google и ChatGPT в том же GEO и на том же языке.
Выборка — пара тысяч промптов. Плюс перепроверено ещё на выборке из 3 тыс. промптов некоммерческого характера: закономерность сохраняется, но вероятности ниже.
Как читать:
👉 по горизонтали — группы позиций в Google;
☝️ по вертикали — вероятность попадания в цитату и поиск.
Например, точки 24 и 25,9 на правом графике означают, что домен, ранжирующийся на 1-м месте в Google, с вероятностью 25,9% будет найден в SERP-слое ChatGPT и с вероятностью 24% будет процитирован.
Выводы делайте сами. Есть над чем подумать. | 2 914 |
| 13 | Я собрал 15 000 промптов через парсинг интерфейса ChatGPT на русском и английском. Это 15 ГБ данных. И вот мои главные выводы.
Надеюсь, для GEO-экспертов не секрет, что есть 2 слоя:
▪️ поиск кандидатов через веер уточняющих запросов
▪️ отбор доменов и URL-адресов для цитирования — дальше буду называть это цитированием
Самая сильная метрика, по которой сайт попадает в цитирование, — это его изначальная позиция в слое поиска кандидатов.
То есть отдельная система ChatGPT находит набор кандидатов и ранжирует их внутри себя. Затем LLM формирует ответ на их основе и чаще всего берет для этого первые результаты из этого слоя. А не уходит искать "экспертный бренд".
И вот что сильнее всего связано с позицией в поиске кандидатов
ВАЖНО: взаимосвязь не равна влиянию. Это может быть прокси-влияние через другой фактор.
1. Максимальная релевантность сниппета URL-адреса основному запросу или веерному уточняющему запросу.
2. Текстовая релевантность заголовков страницы запросам.
3. Там, где важна свежесть материала, она действительно важна :)
4. Частота попадания в поиск кандидатов по веерным запросам влияет на среднюю позицию домена.
Вот тут я считаю, что это как раз прокси взаимосвязь, так как чем больше у сайта релевантных URL-адресов, тем выше вероятность, что среди них окажется максимально подходящая страница.
5. Соответствие типа страницы намерению запроса. Как говорится, хороша ложка к обеду.
Остальные факторы показывают настолько слабую корреляцию, что в Telegram-посте на них нет смысла останавливаться.
Про тематическое соответствие домена запросам
Мой вывод: выгоднее делать контент тематическими кластерами и покрывать тему узкими страницами, но без фанатизма.
ВАЖНО: это не про фактор экспертности бренда, а про то, что такой подход повышает вероятность быть найденным по узким уточняющим запросам.
Если че это я сам написал такой оборот "это не про то, а это про это". не Chagtp.
Но самое главное в GEO и AEO — не просто добиться того, чтобы URL-адреса вашего сайта использовались в цитатах. Главное — чтобы ваш бренд или продукт попадал в тело ответа как решение задачи пользователя. А это уже совсем другая задача.
Выводы делайте сами. Я поделился тем, что видно на данных. | 3 136 |
| 14 | Год назад были судебные слушания над Google, где выступали челы из OpenAI.
Прямая цитата:
«Наша цель — и это была очень амбициозная цель, к которой мы пока и близко не подошли, — обслуживать около 80% нашего трафика из нашего собственного first-party индекса. Мы считаем, что 100% в долгосрочной перспективе достижимо, но это настолько далеко и настолько неопределённо, что это нельзя превратить в операционную цель — даже для группы умных людей, которые амбициозны и верят, что могут сделать невозможное».
Ну короче, они попытались, у них нихуя не получилось. И скорее всего пока они и не будут пытаться.
Решение суда — Google обязан будет делиться данными
Google признан монополистом и должен будет делиться данными с другими компаниями https://www.justice.gov/atr/media/1421546/dl?inline=. В том числе real-time API(s) его SERP, как он это делал бы и для обычных людей. Ну, короче официальное API Google поиска.
В мае 2026 года Google подавал на апелляцию, которую отклонили и дали им несколько месяцев для завершения. | 3 069 |
| 15 | Есть ли свой индекс у ChatGPT и какого он размера?
Вообще не трогаем тему обучения моделей и ответ чисто из ее весов. Исключительно про поиск по базам URL.
Почему ChatGPT, а не Claude или Перплексити? Потому что для 80% населения земли AI = ChatGPT. И у него несравненная доля рынка с другими системами.
Что говорит о создании индекса:
- Поведение ботов OpenAI часто похоже на краулеры, которые обходят страницы сайта.
- Пересечение с Google выдачей падает. С BING пересечение давно крайне низкое.
Мини-эксперимент, который показывает, что ChatGPT использует сторонних SearchAPI провайдеров
Я взял супер редкий поисковый запрос — найди курсы по "продажи seo услуг", по которому явно должен быть мой сайт.
Я убедился заранее, что OpenAI боты не посещали эту страницу и по логике индекса они не должны были быть найдены — https://skr.sh/sbx4fNQwTl1. С момента создания нового сайта школы там стоял счетчик мониторинга визитов AI ботов, который трекает их по IP и User-Agent.
Но эта страница есть в Google https://skr.sh/sbxTfqMtwr0 в индексе.
Простое и логичное объяснение — GPT ходит в Google.
Про пересечение с выдачей
И недавно я спарсил несколько тысяч промптов через скрейпер чата и параллельно делал запросы в Google с тем же ГЕО, проверял мобильные и десктопные выдачи, учитывал fan out если он был у chagtp.
Результаты пересечений Google∩ChatGPT получились на том же уровне, что получают практически все в своих исследованиях в последнее время. В зависимости от ГЕО, типа запроса — между 30-60%.
Мне это показалось достаточно интересным, что практически у всех исследователей пересечение получается в среднем 50%.
Дополнительные SearchAPI
Далее я начал экспериментировать еще больше с промптами, пробовал джелбейки, пока не получил промпт, который банальный, но он очень похож на то, что я получаю в парсингах ChatGPT поиска в чате.
Посмотрите скриншот — https://skrinshoter.ru/sbxUZef01jK. Сайты которые я там отметил, как Google — выдаются в Google SERP по тому же ГЕО.
В нем вырисовывается примерно такая логика поиска: выполнить поиск в Google, выполнить поиск в Wiki и Arxiv.org для сбора дополнительных источников
Если напарсить много промптов и потом посчитать, какие сайты чаще всего цитируются, то мы получим: Reddit, YouTube, Arxiv.org (если по промптам важны были исследования) и прочие сайты, у которых есть свой хороший поиск по ним.
Недавно смотрел сериал, где ГГ реально использует Reddit как поисковую систему, чтобы найти мнения людей по его проблемам.
Объяснение логики по сравнению с Google AIO
Если Google AIO идет просто в Google поиск и формирует ответы с него, то ChatGPT начинает использовать несколько поисковых систем для поиска информации. Скорее всего, похожее поведение и у Google AI Mode.
Выводы
Факт 1 — ≈50% выдачи пересекается с Google.
Факт 2 — ≈25-30% объясняется сторонними API.
В подтверждение собственного веб-индекса остается ≈25-30% URL, где я уверен, что часть объясняется ошибками исследований из-за черных ящиков, которые мы можем только предполагать, какая-то часть кэшем ранее спаршенных сайтов.
И как по мне самое простое объяснение тут такое: OpenAI наобещали ебучие золотые горы инвесторам, и им нужно участвовать в гонке мощностей для обучения ИИ. У них нет ресурсов, чтобы сейчас строить систему для аналога веб-индекса Google, так как это еще одна куча мощностей. Скорее, свой аналог индекса Google — это пока сайд-проект, который развивается фоном. | 2 323 |
| 16 | Есть ли у AI чатов (ChatGPT, Claude, Gemini) свои индексаторы? Типа как Google бот обходит интернет и индексирует сайты. | 2 684 |
| 17 | Простой эксперимент, чтобы понять слабости косинусной близости эмбеддингов для некоторых задач SEO
Что тут на скрине:
1. Результат поиска по запросу «как выбрать ноут для удаленки», где на вход идут 2 идентичных текста, отличающихся абзацем, который меняет смысл. Тексты кину в комментарии. В одном случае про офис (нерелевантный), а второй про удаленную работу (релевантный).
2. Числовые оценки — это уровень релевантности двух текстов. Дельта для подсветки силы алгоритмов.
Лексические алгоритмы не могут найти разницу, так как в тексте у меня «удаленная работа», а в поисковом запросе «удаленка». Оставим их в покое. Если бы у меня была база синонимов, которую собирают Яндекс и Google, то они бы справились в поиске релевантного текста.
Самый прикол — это то, что косинусная близость эмбеддингов посыпалась на относительно небольших текстах, где четко есть один абзац, который задает контраст смысла про удаленку. И, казалось бы, по логике должна случиться векторная магия, но, увы, ее нет. Дельта 0,0085 — это в 65 раз хуже, чем Cross-Encoder.
Косинусные алгоритмы начинают работать, если делить текст на фрагменты (абзацы, предложения) — на рис. смысловые сходства по предложениям и фрагментам.
В защиту косинусов
Косинусы — это удобно, так как вы можете заранее все навекторизовать и хранить в БД (в отличие от Cross-Encoder алгоритма), и когда юзер идет с запросом, то уже можно делать вектор его запроса, искать по БД, вытаскивать тексты, фрагменты, сниппеты по теме и уже доранжировать их. Ну, собственно, как и работают RAG-системы, как они участвуют в алгоритмах Яндекса и Google.
Есть еще куча задач, где косинусы применимы и эффективны. Но SEO-шники возвели косинусы в абсолют и начали считать, что это волшебный алгоритм понимания смыслов, и начали творить дичь. | 3 121 |
| 18 | Дополню немного по косинусной близости эмбеддингов, чтобы лучше прояснить свою позицию
Где это хорошо
1. Из кучи релевантного и не релевантного найти релевантное, чтобы потом доранжировать это.
2. Найти синонимы поисковых запросов, близкие термины, чтобы их потом также доранжировать чем-то другим.
Где это плохо
1. Искать что-то релевантное, где и так все релевантно.
2. Оценивать релевантность больших фрагментов — типа страница к странице, вектор сайта к вектору семантики.
Косинусная близость ломается, когда данных слишком много, когда вектуризуются большие фрагменты обо всем. Она хорошо работает для того, чтобы найти что-то "близкое и тематичное", но для более менее хорошей оценки релевантности нужно использовать доранжирование.
Можете продолжить в комментах, что вы считаете по семантическим косинусам 👇 | 2 629 |
| 19 | Страницы которые цитируются в AEO реально имеют лучшие релевантные фрагменты и какими методами релевантности это можно определить эффективно в Яндекс и Google?
Для анализа взял две выборки:
1. ТОП-30
2. ТОП-10
С разделением на процитированные URL и не цитированные (внутри топа), учитываем квери фан аут и очищаем данные от url которые не дают чанки (видео, короткие посты в соц. сетях и так далее).
А дальше отвечаем на вопросы:
1. Страницы, которые цитируются в AEO, реально имеют лучшие релевантные фрагменты?
2. Если анализировать SERP и искать страницы с сильными фрагментами, какой метод релевантности выбирать: TF-IDF, BM25, token overlap, embeddings или cross-encoder?
Какие методы рассматриваем:
Semantic cosine — cosine-близость embedding поискового запроса и чанка страницы.
Cross-encoder rerank — локальная модель переоценивает пары query ↔ top-N semantic chunks и выбирает лучший чанк
Token overlap — долю токенов запроса, найденных в чанке
BM25 norm — BM25-like релевантность чанка к запросу с IDF и нормализацией длины
TF-IDF cosine — cosine-близость TF-IDF векторов запроса и чанка
😐 Тут сразу спойлер косинусная близость эмбеддингов чанков самый слабый метод, которые не показывает ничего.
Передаю право на ответ для ChatGPT 5.5 из IDE Codex:
Короткий ответ: да, цитируемые страницы чаще имеют более релевантные фрагменты. Но разница не огромная.
Это важно правильно интерпретировать. В топе выдачи большинство страниц уже неплохо релевантны запросу. Поэтому мы не видим разницу “релевантно против нерелевантно”. Мы видим более тонкую вещь: среди уже релевантных страниц AI чаще цитирует те, где есть чуть более точный фрагмент под намерение пользователя.
Лучше всего это видно через cross-encoder. В общем срезе цитируемые домены выигрывают примерно на +0.088 по шкале 0..1. Внутри ТОП-10 разрыв остаётся: около +0.068.
Это не “+8.8% релевантности”. Это плюс 0.088 пункта score. Но среди страниц, которые уже находятся в поисковом топе, такой разрыв выглядит вполне значимым.
По Google картина такая: внутри ТОП-10 лучше всего работает cross-encoder. Он даёт разницу около +0.058. TF-IDF и token overlap тоже дают сигнал, но слабее. А вот semantic cosine по embeddings почти не помогает: он даже слегка уходит в минус. Semantic cosine ловит примерный смысл, а нужно уметь отличать фрагмент, который действительно отвечает на запрос.
По Яндексу важнее учитывать Query Fan-Out. В общем ТОП-30 с учётом веера цитируемые домены выигрывают по cross-encoder, token overlap, TF-IDF и semantic. Но внутри ТОП-10 сигнал становится тоньше: лучше всего держится token overlap, потом cross-encoder. Semantic почти плоский.
Что это значит практически?
Если нужно быстро искать потенциально сильные страницы в SERP, я бы не ставил на один метод.
Мой порядок такой:
Cross-encoder — лучший метод для финальной оценки фрагмента.
TF-IDF и token overlap — хорошие простые сигналы, особенно когда важны точные формулировки запроса.
Embeddings cosine — хороший первичный фильтр для облегчения работы Cross-encoder, но слабый финальный аргумент.
Главный вывод исследования:
AI-цитирование связано не только с позицией сайта в выдаче. У процитированных страниц чаще есть более точный текстовый фрагмент под поисковое намерение. Но в ТОП-10 разница небольшая: все уже примерно релевантны, а цитируемые просто чуть лучше попадают в смысл и формулировку запроса.
Я потом запишу видосик на Ютуб где детальнее все расскажу. Пока выводы буду постить выводы без ухода прям в нюансы.
Вывод 1
Мой вывод по этому исследованию такой — AEO работает как обычный RAG поисковик с реранкером (cross-encoder пары запрос-чанк) по уже релевантной к запросам базе SERP.
Вывод 2
Не ебите себе мозг косинусной близость это очень слабый показатель релевантности, который обходит даже простое вхождение лемм из запросов. Я как то писал пост про то, что делал себе тестовый поисковичок https://t.me/seokotenkov/669 для курса по текстовой релевантности для классического поиска так там аналогично косинусная близость самая пососная штука для поиска релевантных документов и фрагментов страниц. | 2 383 |
| 20 | С днем фрилансера, друзья! В честь праздника мы вместе с моими друзьями из Yagla и коллегами по дижитал цеху решили собрать подборку из 20+ топовых каналов про бизнес, digital и все что с этим связано🔥
👉 Подборка здесь
Что внутри?
→ каналы экспертов по маркетингу, PR, контенту, SEO, платному трафику
→ digital-компании со своими медиа
→ блоги владельцев digital-агентств, топ-менеджеров и CEO компаний
Вас ждут актуальные новости и тренды, экспертиза от практиков индустрии, лайфхаки и успешные кейсы. Одним словом, много-много пользы для всех, кто связан с рынком digital.
🎁 А еще чуваки из Yagla подготовили для вас бесплатный гайд:
→ 5 креативных механик и сценарий вирусного ролика
Зачем вам эта подборка?
Подписаться, полистать каналы, оставить несколько по интересу и расширять кругозор.
👉 ЗАБРАТЬ ПОДБОРКУ | 2 062 |
