Интернет написал себя - Новости IT perec.ru

Интернет написал себя

08.09.2026, 16:01:02 ИТ
✮✮✮✮
Подписаться на «Рифы и пачки / Твоя культура»
Интернет написал себя

Исследование Pew Research Center показало: интернет стремительно заполняется материалами, которые, вероятно, созданы или существенно отредактированы искусственным интеллектом. Среди веб-страниц, опубликованных после запуска ChatGPT, признаки авторства ИИ обнаружили примерно у 35%. Иными словами, более каждой третьей новой страницы могла пройти через генеративную систему — пока люди занимались чем-то менее важным, например пытались понять, кто теперь отвечает за этот текст.

Для оценки исследователи использовали автоматизированные инструменты и машинно-обученную модель, которая искала характерные признаки текста, написанного ИИ. В выборку вошли 10 000 страниц из Common Crawl — проекта, собирающего масштабный массив данных из интернета. Если учитывать весь этот массив, охватывающий период с первых лет Всемирной паутины, признаки ИИ обнаружились у 9,6% страниц. Доля выглядит небольшой лишь до тех пор, пока не вспомнить, что в выборке есть материалы, опубликованные более чем за 30 лет.

Авторы отчёта «How Much of the Internet Is Written With AI?» подчёркивают: среди недавно опубликованных страниц доля вероятного участия ИИ значительно выше. Речь не обязательно идёт о полностью сгенерированном тексте. Во многих случаях система могла написать материал целиком или заметно его переработать.

Особенно часто такие страницы встречаются в коммерческой зоне интернета. Среди материалов, опубликованных в 2026 году и получивших признаки ИИ, большинство относится к доменам .com, которые обычно используют компании и коммерческие проекты. На домены .edu, связанные с образовательными учреждениями США, пришлось около 1%, а на .gov — 0,8%. Вывод не сенсационный, но неприятно логичный: бизнес быстрее других внедряет инструмент, который способен производить контент массово, дёшево и без требования к нему иметь душу.

Исследователи также изучили около 490 000 англоязычных веб-страниц, чтобы определить языковые особенности, связанные с генерацией ИИ. Самыми известными подозрительными признаками считаются длинное тире — em dash — и оксфордская запятая, то есть запятая перед последним «и» в английском перечислении. С 2023 года длинное тире стало встречаться на страницах примерно вдвое чаще, а использование оксфордской запятой выросло на 63%.

Однако авторы предупреждают: сами по себе эти признаки ничего не доказывают. Люди тоже используют тире и запятые — иногда даже по собственной воле. Гораздо показательнее оказался набор слов, которые стали встречаться чаще. Среди них исследование называет «delve» — «углубиться», «interplay» — «взаимодействие» и «testament» — «свидетельство». Их употребление более чем удвоилось. В отчёте приведён и длинный список другой лексики, характерной для текстов ИИ.

Ещё один заметный маркер — отрицательная параллельная конструкция вроде «это не просто X, это Y». Её использование выросло почти втрое. Формула удобна: звучит уверенно, выглядит содержательно и позволяет сделать вид, что мысль только что прошла проверку на глубину.

Распознавать тексты ИИ становится всё труднее: модели осваивают человеческие ошибки, а люди, судя по всему, осваивают машинные штампы. Тем не менее статистическая вероятность участия человека выше у материалов на доменах .edu и .gov. Это не гарантия качества и не сертификат человечности, а лишь вывод по данным исследования.


PEREC.RU

Pew Research Center сообщил о заметном росте вероятного участия искусственного интеллекта в создании интернет-контента. По оценке исследователей, признаки авторства ИИ присутствуют примерно у 35% веб-страниц, опубликованных после запуска ChatGPT. В общей выборке из 10 000 страниц, собранных с использованием данных проекта Common Crawl, доля страниц с такими признаками составила 9,6%. Общая выборка включает материалы, опубликованные за более чем 30 лет существования Всемирной паутины, поэтому она существенно отличается от картины среди новых публикаций.

Исследование проводилось с помощью автоматизированных средств и машинно-обученной модели, которая искала вероятные признаки текста, созданного искусственным интеллектом. Авторы уточняют, что обнаруженные признаки могут указывать не только на полностью сгенерированный материал, но и на текст, который ИИ существенно отредактировал.

Отдельный анализ около 490 000 англоязычных страниц позволил выделить распространённые языковые особенности. Среди них — длинное тире em dash и оксфордская запятая, используемая в английском языке перед последним элементом перечисления. С 2023 года em dash стал встречаться примерно в два раза чаще, а использование оксфордской запятой выросло на 63%. При этом исследователи подчёркивают, что эти особенности нельзя считать доказательством: ими пользуются и люди.

Более заметными маркерами оказались некоторые слова и конструкции. Употребление слов «delve» («углубиться»), «interplay» («взаимодействие») и «testament» («свидетельство») более чем удвоилось. Почти втрое чаще стала встречаться отрицательная параллельная конструкция «это не просто X, это Y». В отчёте также перечислены другие элементы словаря, характерные для текстов, созданных ИИ.

По данным исследования, среди страниц с признаками ИИ, опубликованных в 2026 году, преобладают материалы на доменах .com, которые обычно связаны с коммерческими сайтами. На домены .edu, используемые образовательными учреждениями США, пришлось около 1%, а на .gov — 0,8%. Поэтому страницы на образовательных и государственных доменах в целом статистически чаще оказываются написанными человеком, однако это не является абсолютной гарантией.

Исследование показывает, что определить происхождение интернет-текста становится сложнее. Искусственный интеллект осваивает человеческие языковые модели, а люди всё чаще используют характерные машинные шаблоны, из-за чего различие между человеческим и автоматически созданным контентом постепенно стирается.

Поделиться

Похожие материалы