Как нейросеть режет страницу на фрагменты

Нейросеть режет страницу на фрагменты и цитирует только те, что напрямую отвечают на вопрос.

Нейросеть показывает в ответе кусок текста, вынутый из страницы. Страница сначала режется на фрагменты по 200-500 токенов, каждый оценивается по смысловой близости к вопросу, до ответа доходят единицы. По разбору AirOps, до ответов ChatGPT дошли 15 процентов найденных страниц. Отсюда рабочая единица: абзац, который читается отдельно от всего остального.

Единица цитирования - фрагмент, а не страница

В ответ попадает абзац или короткая часть раздела. Ссылка внизу ведет на страницу целиком, но текст, который читает человек, склеен из нескольких кусков, и ваш стоит рядом с фрагментами трех-четырех чужих сайтов.

Разница с обычной выдачей тут принципиальная. В выдаче соревнуются страницы. У каждой одна позиция, и все ее содержимое едет вместе. В ответе нейросети соревнуются фрагменты. Страница может быть сильной по всем привычным меркам и не отдать ни одного пригодного куска, потому что ее абзацы не читаются в отрыве от соседних.

Рынок привыкал к этому болезненно. Страница услуг на четыре тысячи слов, где расписаны опыт компании, этапы работ, оборудование и отзывы, может остаться без единой цитаты. Читателю она нравится. Отбору она не дает зацепки: цена размазана по трем разделам, а сроки упомянуты в подписи к фотографии.

Меняется и отношение к объему. Материал на шесть тысяч слов раньше работал как аргумент в разговоре с клиентом: чем полнее закрыта тема, тем выше шанс на топ, и спорить с этим никто особо не пытался. Теперь же объем сам по себе не дает ничего. По нашим наблюдениям, статья такого размера отдает в ответ один абзац, изредка два, а остальные тысячи слов участвуют разве что фоном.

В одном ответе куски разных сайтов отвечают каждый за свою часть вопроса. Ваш абзац про сроки может стоять рядом с чужим про цены, а из брендов в тексте назовут один - тот, чей кусок стоял первым. Поэтому бороться приходится за конкретную фразу внутри ответа.

Обратная сторона приятнее. Одна страница может отдавать разные фрагменты в разные ответы: абзац про сроки цитируют по вопросу о доставке, абзац про гарантию - по вопросу о возврате. Небольшой сайт получает шанс там, где по классической выдаче он проигрывает агрегатору с тысячей страниц.

Вы перестаете спрашивать «что еще дописать на страницу» и переходите к другому вопросу: «какой отсюда абзац можно вынуть щипцами и показать человеку без всякого контекста». Часто выясняется, что ни одного. Другим становится и техзадание автору: вместо объема и списка запросов в него идут требования к устройству абзаца. Генеративную оптимизацию разобрали в статье что такое GEO, а список причин, по которым сайт вообще не доходит до ответов ChatGPT, есть в отдельном материале. Здесь речь только про текст внутри страницы.

Схема: страница делится на фрагменты, часть из них отбирается в ответ
Страница режется на фрагменты, до ответа доходят единицы, и порядок отбора важен.

Как страница режется и какие фрагменты отбираются

Система находит страницы-кандидаты, режет каждую на фрагменты (чанки), переводит их в числовые векторы, сравнивает с вопросом и отбирает несколько штук. Из отобранного собирается текст ответа.

Размер фрагмента задается не вашей версткой. Свои параметры нарезки ни одна из систем не публикует, поэтому ориентироваться приходится на инженерную практику: MongoDB в руководстве по чанкингу называет рабочим для задач поиска диапазон 200-500 токенов. Токен короче слова, и на кириллице разница заметнее, чем на английском: русский текст расходует токены быстрее. Прогоните абзац через токенизатор OpenAI и увидите свою цифру. Для русскоязычных страниц мы держим ориентир 80-200 слов на фрагмент - это наша рабочая рамка, а не опубликованный норматив.

Где пройдет граница куска, зависит от разметки текста. Заголовки и абзацные отбивки для системы - естественные швы, и по ним она режет охотнее, чем по счету символов. Сплошное полотно без подзаголовков режется механически, и тогда мысль рвется пополам: начало осталось в одном фрагменте, вывод уехал в следующий.

Дальше идет отбор. В набор попадают единицы фрагментов, и у них есть порядок: первые позиции влияют на ответ сильнее последних. Второй и третий фрагмент могут дать формулировку. А могут не дойти до текста вообще.

Отобранный кусок не всегда идет в ответ один. По нашим наблюдениям за ответами, вместе с фрагментом система нередко забирает контекст страницы: заголовок, соседние подзаголовки, вводный блок сверху. Поэтому осмысленная структура работает дважды - помогает разрезать текст по швам и дает системе рамку, в которую она ставит найденный кусок.

Сравнение идет по смыслу, а не по совпадению слов. Ahrefs изучил 1,4 млн промптов ChatGPT и намерил у процитированных страниц смысловую близость к вопросу 0,602 против 0,484 у найденных, но не процитированных. Плотность вхождений на отбор фрагмента не влияет: абзац, набитый повторами запроса, проигрывает соседу, который отвечает на вопрос человеческими словами. Разметка Schema.org, о которой будет отдельный разбор, помогает системе понять сущности на странице, но границы фрагментов задает текст.

Вашей верстки система не видит. Красивый блок с иконками, аккордеон с вопросами - от всего этого на входе у отбора остается текст и его порядок в коде страницы. Если ответ разбросан по четырем плиткам, в текстовом виде он склеивается в кашу.

Работает и потолок по объему. Платформы своих порогов не раскрывают, но независимые замеры Kevin Indig дают такую картину: модель обрабатывает первые 20-30 процентов текста, прежде чем решить, читать ли дальше. Разросшаяся страница теряет хвост: то, что стоит в конце длинного материала, часто до оценки не доходит.

Вопрос человека почти никогда не идет в поиск в исходном виде: система разворачивает его в несколько подзапросов. Механику разбираем в статье про query fan-out, здесь достаточно помнить, что ваш абзац сравнивают не с той формулировкой, которую набрал человек.

Найдено не значит процитировано

Система открывает заметно больше страниц, чем показывает. AirOps разобрал 548 534 страницы, найденные по 15 000 промптов: до финального ответа дошли 15 процентов, остальные 85 были прочитаны, оценены и отброшены.

Для работы это две разные задачи. Попасть в набор кандидатов - вопрос техники: индекс, скорость отдачи, доступность страниц для ботов. Попасть в ответ - вопрос текста. Признаки успеха тоже разные, и путать их дорого: сайт может отлично проходить первую стадию и годами проваливать вторую.

Ahrefs в своем разборе промптов показывает, что часть отсева происходит до открытия страницы, по заголовку, адресу и сниппету. Дальше отсеивают уже содержимое. Фрагмент читают и не берут по трем причинам: из него нечего вынуть отдельно, в нем утверждение без опоры, формулировка размыта настолько, что подставить ее в ответ рискованно.

По рынку ходят два ряда цифр, которые звучат противоположно. По данным Semrush, около 40 процентов источников AI Overviews входят в органический топ-10, значит, обзор опирается на страницы, которые уже ранжируются. Тот же Semrush по ChatGPT дает другую картину: цитаты нередко приходят со страниц ниже двадцатой позиции. Противоречия нет, системы разные: одна собирает ответ поверх собственной выдачи, вторая ищет отдельным механизмом и вытягивает то, что лучше отвечает на подзапрос.

Отброшенное все же работает, только молча. Прочитанный текст влияет на то, какими словами модель опишет тему и какие бренды назовет без ссылки. Упоминание без ссылки тоже видимость, но измеряют его иначе.

Есть и третий сценарий, где ссылок не будет ни у кого. Модель отвечает из того, что усвоила при обучении, и веб-поиск не запускает вовсе. Тогда под ответом пусто, а бренды в тексте появляются по памяти модели. Эту часть видимости абзацами не берут, она набирается упоминаниями на чужих площадках.

В логах сервера боты по сайту ходят, а цитат в ответах нет. Владелец сайта в такой ситуации решает, что дело в технике, и уходит чинить то, что уже исправно. Диагностика начинается с разделения двух стадий. Метрики и способы замера разбирали в статье про измерение видимости в нейросетях.

Что делает фрагмент самодостаточным

Самодостаточный фрагмент - тот, который остается понятным, когда вокруг него нет ни статьи, ни заголовка страницы. Связку «вопрос в заголовке, короткий ответ под ним, объяснение дальше» вы наверняка знаете. О ней мы писали в материале про то, где размещать контент для нейросетей. Остальное решается внутри абзаца.

Одна тема на фрагмент

Абзац, где смешаны цена, сроки и гарантия, оценивается хуже, чем три отдельных абзаца, по одному на каждую тему. Смысловой вектор такого куска размазан между темами и не совпадает толком ни с одним вопросом.

Подлежащее вместо местоимения

«Этот подход», «он», «такая схема» вне контекста страницы не читаются. Модель видит кусок, где стоит одно местоимение, а сам предмет разговора остался в предыдущем абзаце. Такой фрагмент в ответ не пойдет. Начинайте каждый абзац так, будто читатель попал сюда с улицы.

Субъект назван внутри абзаца

Если компания, продукт или город упомянуты только в H1, во фрагменте их нет. Абзац про доставку должен сам сказать, чьи это сроки и в какие города.

Факт рядом с тезисом

Цифра, которая стоит через два раздела от тезиса, при нарезке остается сама по себе, а тезис - без опоры. Оба куска теряют вес. В работе исследователей Princeton, Georgia Tech, Allen Institute for AI и IIT Delhi 2023 года, где и появился термин GEO, показано: конкретная статистика и цитаты названных экспертов внутри текста поднимают шанс попасть в генеративный ответ.

Ответ в первых строках

Вступление съедает первые строки фрагмента, а они весят больше всего. По его же разборам цитат, модели тянут содержимое из первых сотен слов заметно чаще, чем из глубины материала.

Никаких визуальных отсылок

«Выше», «на схеме слева», «как мы писали в начале» - в вырезанном куске все это указывает в пустоту.

Формулировки, которыми спрашивают люди

Спрашивают «сколько стоит вывоз мусора», а на странице написано «стоимость услуг по обращению с ТКО». Смысловая близость такого куска к вопросу низкая, хотя формально страница про то же самое. Название услуги по документам оставьте, но рядом дайте формулировку, которой пользуются люди.

Единицы, период и город рядом с цифрой

«12 месяцев», «до 14 часов», «по Алматы» - кусок с такими деталями цитируется охотнее, чем тот, где число стоит без привязки. Число без единиц проверить нельзя, и ставить такое в ответ рискованно.

Заголовок раздела как якорь вопроса

Кусок часто отбирают вместе с подзаголовком, и тот работает как подпись к содержимому. «Сроки доставки по Ташкенту» точнее, чем «Логистика», и ближе к тому, как спрашивают люди.

Меньше оговорок

«Может зависеть от многих факторов», «в ряде ситуаций возможны отклонения» - модель ищет тезис, который можно поставить в ответ со ссылкой на источник. Рассуждение с тремя оговорками ставить некуда. Если ограничение существует, назовите его точно: вместо «зависит от площади» - «для квартир до 60 квадратных метров».

Разбор: было и стало

Три пары абзацев с сайтов сервисных компаний, текст обезличен. В каждой паре первый вариант читается внутри страницы и разваливается вне ее, второй несет тот же смысл и работает отдельным куском.

Один абзац до переписывания и после, рядом
Тот же смысл в двух вариантах: первый разваливается вне контекста страницы, второй читается отдельно.

Пара 1 - местоимения и отсылки

Было на странице: «Этот способ подходит тем, кто уже прошел первый этап. Он дешевле предыдущего и занимает меньше времени, а сроки те же, что мы назвали выше».

Переписали так: «Ремонт холодильника на дому занимает от двух часов и обходится дешевле замены компрессора в мастерской. Мастер выезжает в день заявки, диагностика входит в стоимость работ».

Разница: в куске появились предмет разговора, действие и цифра. Первый вариант без соседних абзацев не значит ничего: непонятно ведь, что за способ и какие сроки. Внутри страницы он держался на предыдущем абзаце, а при нарезке эту опору отрезали.

Пара 2 - две темы в одном куске

Текст с сайта сервиса: «Компания открылась в 2014 году и обслуживает клиентов в Алматы и Астане, диагностика стоит от 5000 тенге, на все работы дается гарантия 12 месяцев, записаться можно через сайт или мессенджер».

После правки абзац разошелся на два. Первый: «Диагностика в сервисе стоит от 5000 тенге и занимает около часа. Стоимость вычитается из суммы ремонта, если вы соглашаетесь на работы». Второй: «Гарантия на ремонт бытовой техники - 12 месяцев, она указана в акте выполненных работ. Гарантия действует в Алматы и Астане, где у сервиса свои мастерские».

Что поменялось: одна тема на фрагмент, каждый отвечает на свой вопрос. Исходный кусок проигрывал по всем четырем вопросам сразу: его смысловой вектор находился где-то между историей компании, ценой, гарантией и способом записи, и ни к одному из них не приближался.

Пара 3 - цифра без опоры и без субъекта

Исходный абзац: «Скорость доставки выросла почти вдвое, а сроки сборки заказа сократились».

Стало: «Доставка по Алматы занимает один день, по регионам Казахстана - три-четыре дня. Заказ собирают до 14 часов, если товар на складе; сроки прописаны в договоре».

Вместо роста, у которого нет ни базы сравнения, ни субъекта, здесь стоят проверяемые числа с привязкой к городу и условию. Первый вариант нельзя ни процитировать, ни опровергнуть, поэтому он никуда и не попадает.

Общее по трем парам: новых фактов мы не добавляли ни разу, все нужное на страницах уже стояло, только разложено было так, что вынуть оттуда цельный кусок не получалось.

Из-за чего фрагмент не забирают

Причины повторяются от сайта к сайту, и почти все они про форму, а не про экспертизу автора.

  • Стена текста без заголовков. Границы фрагментов система расставит сама, по своим правилам, и почти наверняка разрежет мысль пополам. Подзаголовок каждые два-три абзаца снимает проблему.
  • Заголовок-приманка, под которым нет ответа. «Сколько стоит переезд», а дальше три абзаца про историю компании: фрагмент отобрали по заголовку и выбросили по содержимому.
  • Ответ, спрятанный в середине раздела. Перед ним вступление на пять фраз о важности темы, и до сути отбор не доходит.
  • Тезис здесь, доказательство в другом разделе. При нарезке они расходятся по разным кускам, и каждый становится слабее: один звучит голословно, второй висит без вывода.
  • Страдательный залог там, где нужен субъект. «Работы выполняются в срок» - кем, где, за сколько. Прямой порядок слов читается и человеком, и машиной.
  • Три темы в одном H2. Заголовок «Цены, сроки и гарантия» обещает три ответа, а раздел под ним система разрежет по-своему, и в каждом куске окажется хвост чужой темы.
  • Шаблонный блок, повторенный на сорока страницах. Одинаковый текст про гарантию в подвале каждой карточки не дает системе повода выбрать конкретную страницу, а иногда и вовсе мешает понять тему карточки.
  • Содержимое, вынесенное в подпись к картинке или в таблицу. Текстовый отбор такое видит хуже, а иногда не видит вовсе; цифру из таблицы стоит продублировать фразой.

Отдельная беда - абзацы длиной в один экран. Они занимают фрагмент целиком, тянут в него посторонние темы и размывают смысловой вектор. Держите абзац в две-четыре фразы; прямой ответ под заголовком мы укладываем в 50-80 слов.

Бывает и обратный перегиб. Текст, где каждая мысль вынесена в отдельный абзац из одной строки, читается рвано и для отбора бесполезен: слишком короткий кусок беден смыслом и проигрывает нормальному абзацу конкурента. Самодостаточному куску нужна полнота мысли, а рубленый ритм ее не дает.

Как проверить свои страницы

Четыре проверки, которые делаются без инструментов и занимают полчаса на страницу.

Тест на изоляцию

Скопируйте абзац в пустой документ и прочитайте его так, будто видите впервые. Понятно, о чем речь, кто действующее лицо и к чему относятся цифры? Если для понимания нужен соседний текст, фрагмент не готов.

Проверка вопросом

Дайте модели текст страницы и задайте конкретный вопрос из своей ниши. Смотрите не на качество ответа, а на то, какой кусок она вытащила и вытащила ли вообще. Если она пересказывает своими словами вместо цитаты, извлекать пока нечего.

Подмена темы

Спросите у модели, о чем этот абзац. Расхождение с вашим замыслом означает, что кусок грязный: в нем две темы или тема названа неточно. Формулировки вопросов для таких проверок удобно брать из списка промптов клиентов, про сбор которых есть отдельная статья.

Сверка с тем, кого уже цитируют

Задайте свой вопрос в двух-трех системах, откройте источник из ответа и найдите там процитированный кусок. Дальше сравнивайте абзацы, а не сайты: длину, наличие субъекта, место цифры. Разница видна за минуту, и почти никогда она не в глубине материала.

Ответ нейросети с процитированным фрагментом и ссылкой на источник
В ответ попадает конкретный абзац страницы, а ссылка внизу ведет на нее целиком.

До правок зафиксируйте базу, иначе эффект не с чем будет сравнить. Минимум: список страниц, которые правите, дата начала, 10-15 вопросов и текущие ответы систем по ним со скриншотами. Отдельной колонкой отметьте, кого цитируют сейчас вместо вас.

Через месяц прогон повторяется теми же вопросами в том же порядке. Смотреть стоит на две вещи: появились ли ссылки на ваши страницы и попал ли в ответ тот абзац, который вы переписывали. Второе важнее: оно показывает, что правка сработала так, как задумано, а не совпала с чужими перестановками в выдаче.

Частить не стоит. Ответы систем шатаются сами по себе, и разница между прогонами через неделю расскажет больше про случайные колебания, чем про вашу работу. Месяц - разумный шаг для страниц, которые уже в индексе.

Коротко

  • Нейросеть цитирует фрагмент текста: в ответе стоит один кусок, а ссылка под ним указывает на всю страницу.
  • Для отбора страницу режут на фрагменты по 200-500 токенов; на русском это ориентировочно 80-200 слов.
  • AirOps разобрал 548 тысяч страниц: до ответа доходят 15 процентов найденного, остальное читается без ссылки.
  • Отбор идет по смысловой близости: Ahrefs намерил у процитированных страниц 0,602 против 0,484 у непроцитированных.
  • Самодостаточный абзац несет одну тему, называет субъект и держит цифру рядом с тезисом.
  • Найдено и процитировано - разные стадии: первая держится на технике, вторая на форме текста.
  • Проверка на извлекаемость - копия абзаца в пустой документ и вопрос к модели о том, что она из него вынет.

Об авторе

Марат Аксанов, сооснователь GEO-агентства HITZ. Занимается видимостью брендов в поисковых системах и генеративных ответах, ведет собственные замеры цитируемости по рынкам Казахстана и Узбекистана.

Об агентстве

HITZ - агентство генеративной оптимизации в Казахстане и Узбекистане. Работаем с видимостью компаний в ответах ChatGPT, Алисы, Google AI Overviews и Perplexity: услуга GEO. Связаться можно через Telegram или форму на сайте.

Частые вопросы

Какой длины должен быть абзац, чтобы его забрали в ответ?

Держите две-четыре фразы, а прямой ответ под заголовком укладывайте в 50-80 слов. Такой кусок целиком помещается в границу фрагмента, и вторая тема в него не попадает. Короткие абзацы тоже работают, если в них есть субъект и цифра. Длина сама по себе не гарантирует цитату: важнее, чтобы кусок читался без остального текста страницы.

Влияет ли общий объем статьи на попадание в ответ?

Напрямую не влияет, а косвенно мешает. Отбор идет по фрагментам, поэтому две тысячи слов не дают преимущества перед восемью сотнями. При этом хвост длинного материала часто остается неоцененным: по замерам Kevin Indig модель разбирает первые 20-30 процентов страницы и уже по ним решает, читать ли дальше. Сильные утверждения из конца статьи стоит переносить выше.

Нужно ли повторять название компании в каждом разделе?

В каждом не нужно. В тех разделах, где вы хотите цитату, - да. Фрагмент вырезается без H1, и если субъект остался только в заголовке страницы, в куске его нет. Достаточно естественного упоминания в первой-второй фразе раздела: кто оказывает услугу, в каком городе. Если вставлять название в каждый абзац подряд, текст станет нечитаемым для человека.

Бот заходит на сайт, а цитат нет. В чем причина?

Это две разные стадии, и вы прошли первую. Попадание в набор кандидатов зависит от индексации и доступности страниц, попадание в ответ - от текста. По разбору AirOps 85 процентов найденных страниц отсеиваются после прочтения. Смотрите на форму: есть ли у страницы куски с прямым ответом, названным субъектом и цифрой рядом с тезисом.

Портит ли короткий абзац читаемость для человека?

Наоборот, помогает, если абзацы не превращаются в цепочку рубленых фраз одинаковой длины. Короткий абзац с одной мыслью читается быстрее с телефона, а разная длина соседних абзацев держит ритм. Портит текст другое: механическая нарезка длинных предложений на куски по одной строке, после которой связь между мыслями пропадает.

Как объяснить эти правила копирайтеру одной страницей?

Дайте четыре требования: одна тема на абзац, субъект назван внутри абзаца, ответ в первых двух фразах раздела, факт рядом с тезисом. Плюс запрет на отсылки вида «выше» и «как мы уже сказали». Проверка одна: взять любой абзац отдельно от страницы и прочитать свежим взглядом. Если без остального текста непонятно, абзац переписывается.

Обсудить проект
+7 706 624 20 40