← Все статьи
2026-07-24 20:02 · 🤖 AI World

ClickGuard распознаёт кликбейт с точностью 91% и выдаёт спойлер вместо перехода

Группа польских исследователей представила браузерное расширение ClickGuard: оно детектирует кликбейт-заголовки с F1-score 91% и сразу показывает суть статьи в двух предложениях — без перехода по ссылке. Это уже не просто фильтр, а инструмент, который меняет саму экономику кликбейт-медиа.

ClickGuard распознаёт кликбейт с точностью 91% и выдаёт спойлер вместо перехода

В мае 2026 года на arXiv появилась работа команды из пяти исследователей: они описали браузерное расширение ClickGuard, которое в реальном времени оценивает вероятность того, что перед вами кликбейт. Архитектура гибридная: XGBoost поверх трансформерных эмбеддингов плюс лингвистически мотивированные признаки и авторский «baitness score». На открытом комбинированном датасете модель достигла F1-score 91%. Расширение работает в два этапа: предупреждает до перехода и объясняет решение после открытия статьи.

Контекст

Кликбейт — это не просто раздражающий формат. Это бизнес-модель: заголовок обещает одно, текст даёт другое, рекламная сетка монетизирует клик. Медиа-экономика давно обучила редакции, что «шокирующий факт» продаёт лучше точного изложения. В 2026 году, когда генеративный ИИ штампует заголовки за секунды, масштаб проблемы только вырос.

Академические попытки автоматически детектировать кликбейт существуют с середины 2010-х. Ранние модели работали на TF-IDF и классических классификаторах. Потом подтянулись BERT-подобные архитектуры. Авторы ClickGuard пошли дальше: они не просто классифицируют, а объясняют решение через конкретные метрики и предлагают немедленную альтернативу — «clickbait spoiler»: 1-2 предложения с сутью материала прямо в интерфейсе расширения.

Принципиально важен уровень деплоя: расширение работает на стороне пользователя, а не на серверах издания. Никакого договора с редакцией не нужно. Технически это сложнее заблокировать, чем серверный фильтр, и проще масштабировать на любые языки при наличии датасетов.

Аналитика

91% F1 — хороший результат, но важнее архитектурный выбор: авторы сохранили лингвистически мотивированные признаки рядом с LLM-эмбеддингами вместо того, чтобы полностью уходить в end-to-end нейросеть. Это не случайно: чистые LLM-решения интерпретируемы хуже, а интерпретируемость критична для объяснения пользователю «почему это кликбейт». Та же логика применяется в коммерческих антиспам-системах.

Функция спойлера — самая интересная часть с продуктовой точки зрения. Она меняет пользовательское поведение: вместо бинарного «кликнуть или нет» появляется третий вариант — прочитать суть без перехода. Это прямой удар по рекламной монетизации кликбейт-изданий. Если подобные инструменты получат широкое распространение, у медиа появится структурный стимул улучшать качество заголовков — не из этических соображений, а из-за падения CTR.

Открытый вопрос — языковое покрытие. Большинство публичных датасетов кликбейта англоязычные. Насколько модель работает на русском, кыргызском или казахском контенте — авторы не раскрывают. Для рынков СНГ и Центральной Азии нужны отдельные датасеты и, по всей видимости, дообучение. Это одновременно ограничение текущей работы и ниша для локальных команд.

Кейсы применения в бизнесе

B2B-SaaS медиамониторинг. Сервисы мониторинга упоминаний и медиааналитики могут встроить подобный скоринг в свои API. Клиент получает не просто ссылку, а автоматическую оценку: это объективный материал или кликбейт. Для PR-команды и репутационных аналитиков — принципиальная разница при подготовке отчётов для руководства.

Редакция или контент-агентство. Инвертированная задача: не детектировать чужой кликбейт, а проверять собственные заголовки до публикации. Простой lint-шаг в редакционный workflow — и бренд получает инструмент для аргументации доверительного стиля перед рекламодателями и партнёрами.

Новостной агрегатор или локальный медиапортал в КР/СНГ. Небольшие ресурсы в регионе начинают конкурировать за доверие аудитории, а не только за клики. Автоматический скоринг входящего контента при агрегации — дешёвый способ фильтровать низкокачественные источники. Технически достаточно Python-обёртки над open-source моделью.

Кейсы в личной жизни

Разработчик / NLP-энтузиаст. Открытые датасеты кликбейта (Webis-Clickbait-17 и другие, доступные на HuggingFace) — готовая база для русскоязычной адаптации подхода. Хороший pet-проект с реальным применением: обучить классификатор на русских заголовках и выложить как open-source.

Активный потребитель новостей. Пока публичной версии расширения нет, уже сейчас работает простой промпт-детектор: скопируй заголовок и спроси LLM — «этот заголовок описывает факт или создаёт интригу без разрешения?» Результат удивит точностью.

Контент-мейкер / SMM. Скормить свои последние 20-30 заголовков классификатору — и получить самодиагностику редакционного стиля. Это и инструмент для роста, и аргумент перед клиентом: «наш контент строится на доверии, а не на триггерах».

Как применить сегодня

  • Найти работу по идентификатору arXiv:2607.20463 — авторы прикладывают демо-видео, которое даст практическое представление об UX расширения.
  • Запустить промпт-тест прямо сейчас: скопируй любой заголовок и спроси Claude или GPT — «оцени этот заголовок по шкале кликбейта от 0 до 10, назови конкретные лингвистические признаки».
  • Изучить открытые датасеты кликбейта на HuggingFace — отправная точка для русскоязычной адаптации модели.
  • Для контент-команды: ввести правило — заголовок не должен содержать открытый вопрос без ответа в тексте, числовое обещание без подкрепления, интригу ради интриги.
  • Следить за возможной публикацией кода авторов — при появлении репозитория попробовать локальный деплой как внутренний инструмент редакции.
← Все статьи