
Добавим к этому и результаты исследований ранее, где в рейтинге галлюцинаций компактные модели стоят выше «рассуждающих» флагманов. Секрет не в размере, а в том, на каких данных модель обучена и подо что заточена.
Практический вывод. Начинайте выбор модели не с вопроса «какая самая мощная», а с вопроса «какая самая маленькая из тех, что решают мою задачу». Проверяется это за неделю: возьмите свои двадцать типовых запросов и прогоните через флагманскую и компактную модель. Если разницы в качестве нет, а счёт отличается в десять раз, выбор сделан за вас.
Ограничения ИИ, которые приводят к проблемам
Ранее я привёл «базовые» проблемы ИИ. Теперь уйдём в специфику именно генеративного ИИ.
Беспокойство компаний о своих данных. Любой бизнес стремится охранять корпоративные данные. Отсюда две проблемы. Во-первых, компании запрещают онлайн-инструменты за периметром защищённой сети, а любой запрос к онлайн-боту — это обращение во внешний мир (как хранятся, защищены и используются данные — вопросов много). Во-вторых, это ограничивает развитие любого ИИ: все хотят рекомендаций от обученных моделей (например, предсказание поломки оборудования), но делиться своими данными не готовы. Замкнутый круг. Оговорка: некоторые уже умеют размещать модели уровня GPT-3/3.5 внутри контура компании, но их всё равно надо обучать — это не готовые решения, и службы безопасности найдут риски.
Сложность и дороговизна разработки и содержания. Разработка «общего» генеративного ИИ — это десятки миллионов долларов и очень много данных. КПД нейросетей пока низкий: где человеку хватает 10 примеров, сети нужны тысячи и сотни тысяч (хотя она находит взаимосвязи в массивах, которые человеку не снились). Из-за ограничения по данным тот же ChatGPT лучше «соображает» на английском, чем на русском, — англоязычный сегмент интернета больше. Добавьте электроэнергию, инженеров, обслуживание и модернизацию оборудования — и получите те самые 700 000 долларов в день только на содержание ChatGPT. Снизить затраты можно, убрав всё лишнее, но тогда это будет узкоспециализированный ИИ. Поэтому большинство решений на рынке — по сути «GPT-фантики», надстройки к большим моделям.
Беспокойство общества и ограничения регуляторов. Общество обеспокоено развитием ИИ, а государства не понимают, чего от него ждать. Здесь несколько факторов:
— Влияние. Генеративный ИИ доказал, что создаёт контент, который можно спутать с человеческим (тексты, изображения, научные работы), и за секунды разрабатывает концептуальный дизайн микросхем и шагающих роботов.
— Безопасность. ИИ активно используют злоумышленники: по данным SlashNext (State of Phishing, 2023), за год с момента запуска ChatGPT число фишинговых атак выросло на 1265%.
— Непрозрачность. Как работает ИИ, порой не понимают и сами создатели — для столь масштабной технологии это опасно.
— Зависимость от «учителей». Модели строят и обучают люди; материал для обучения узкоспециализированных моделей тоже отбирают люди.
Всё это означает, что отрасль начнут регулировать и ограничивать. Вспомним и известное письмо марта 2023 года, в котором эксперты потребовали ограничить развитие ИИ. Здесь я только фиксирую барьер; что уже происходит с регулированием и чего ждать дальше — разбираю в Главе 7.
Недостаток модели взаимодействия с чат-ботами. Вероятно, вы уже пробовали общаться с чат-ботами и остались разочарованы: классная игрушка, но что с ней делать? Чат-бот — не эксперт, а система, которая угадывает, что вы хотите услышать, и выдаёт именно это. Чтобы получить пользу, вы сами должны быть экспертом в теме. Но если вы эксперт — нужен ли вам ГИИ? А если нет — решения не получите, только общие ответы. Замкнутый круг: экспертам не нужно, любителям не поможет. Кто тогда заплатит? На выходе — дорогая игрушка.
Кроме экспертности нужно ещё уметь формулировать запрос — таких людей единицы. В какой-то период даже была профессия промпт-инженера (стоимость — около 6000 рублей в час), и то он не мог подобрать идеальный запрос с первого раза (он не обладает предметной экспертизой). Лайфхак: можно попросить ИИ задать наводящие вопросы и на их основе сформулировать идеальный запрос — об этом отдельно поговорим в главе про языковые модели. Нужен ли бизнесу инструмент, делающий его зависимым от очень редких и дорогих специалистов, если обычные сотрудники не извлекут из него пользы? Рынок для обычного чат-бота не просто узкий — он исчезающе мал. Исключения два: чат-бот как вспомогательный функционал к основному (подготовка рекомендаций, аналитических дашбордов, где вы чётко формулируете требования) и применение ИИ в конкретных бизнес-процессах (HR-консультации новых сотрудников, техподдержка, анализ данных).
Некачественный контент и галлюцинации. Нейросети собирают данные и не анализируют факты и их связанность: на что больше в интернете/базе, на то и ориентируются, не оценивая написанное критически. Поэтому ГИИ легко генерирует ложный или некорректный контент, а ИИ-галлюцинации — давно известная особенность.

Галлюцинации нейросетей: что это такое, почему они возникают и что с ними делать
Хорошо, когда случаи безобидны. Но бывают опасные ошибки. Один пользователь спросил у Gemini, как сделать заправку для салата: по рецепту нужно было добавить чеснок в оливковое масло и оставить при комнатной температуре. Пока чеснок настаивался, появились странные пузырьки; перепроверка показала, что в банке размножались бактерии, вызывающие ботулизм, — отравление токсином протекает тяжело, вплоть до смерти. Я и сам периодически использую ГИИ, и чаще он даёт не совсем корректный, а порой откровенно ошибочный результат: нужно 10—20 запросов с безумной детализацией, чтобы получить что-то вменяемое, что потом всё равно надо дорабатывать. За ним нужно перепроверять, поэтому полностью делегировать задачу ИИ невозможно — он скорее ассистент, чем заменитель. И снова приходим к тому, что нужно быть экспертом, чтобы оценить корректность, — а это порой дольше, чем сделать с нуля самому. Как системно управлять неточностями (галлюцинациями) на уровне внедрения — отдельно разобрано в книге «ИИ-2. Практическое руководство» (Глава 15).
Эмоции, этика и ответственность. Без правильного запроса ГИИ просто воспроизводит информацию, не обращая внимания на эмоции, контекст и тон, — а сбой в коммуникации происходит очень легко, и к проблемам выше добавляются конфликты. Возникают и вопросы авторства и прав собственности на созданный контент: кто отвечает за недостоверные или вредоносные действия, совершённые с помощью ГИИ, и как доказать авторство? Нужны этические стандарты и законодательство.
Что же делать?
Компании не собираются полностью отказываться от больших моделей: Apple использует ChatGPT в Siri для сложных задач, Microsoft — модель OpenAI как ассистента в новой версии Windows. При этом Experian (Ирландия) и Salesforce (США) уже перешли на компактные модели для чат-ботов и обнаружили ту же производительность при значительно меньших затратах и задержках. Ключевое преимущество малых моделей — тонкая настройка под конкретные задачи и данные: по словам Йоава Шохама (AI21 Labs), небольшие модели отвечают всего за одну шестую стоимости больших.
Свежий пример того же сдвига — уже не у стартапов, а у самой Microsoft. В июле 2026 года она вывела в открытое тестирование собственные модели семейства MAI: по её данным, голосовая MAI—Voice-2-Flash в контакт-центрах Dynamics 365 (среди клиентов — T-Mobile и EasyJet) снижает затраты на вычисления до 89% по сравнению с моделями OpenAI, а MAI—Image-2.5 в PowerPoint — до 84%. Цифры стоит читать с поправкой: это заявление вендора, а не независимый замер, и соотношение сильно зависит от объёма запросов, размера модели и того, с каким тарифом идёт сравнение. Но направление показательно: компания, вложившая в OpenAI 13 млрд долларов, строит собственные модели — чтобы не платить за флагман там, где хватает специализированного. Вывод для вас проще, чем для Microsoft: если даже ей невыгодно гонять флагманскую модель на потоковых задачах — распознавании речи в колл-центре или картинках для презентации, — то вам тем более. Флагман берите на сложное рассуждение и разовые задачи, узкую модель — на всё, что повторяется тысячи раз в месяц.
Не спешить. Ожидать заката ИИ не стоит: слишком много вложено за последние 10 лет и слишком велик потенциал. Я рекомендую вспомнить 8-й принцип Дао Toyota (основа бережливого производства и один из инструментов моего системного подхода): «Используй только надёжную, испытанную технологию». Из него — ряд рекомендаций: технологии призваны помогать людям, а не заменять их (часто стоит сначала выполнить процесс вручную); вместо непроверенной технологии лучше использовать отработанный процесс; перед внедрением проводить испытания в реальных условиях; отклонять технологию, идущую вразрез с культурой и угрожающую стабильности; и при этом поощрять поиск новых путей, оперативно внедряя зарекомендовавшие себя решения. Через 5—10 лет генеративные модели станут массовыми, дешёвыми и достаточно умными, выйдут на плато продуктивности, и каждый будет пользоваться результатами ГИИ. Но уповать на ИИ и сокращать людей уже сейчас — явно избыточно.
Повышать эффективность и безопасность. Практически все разработчики сейчас делают модели менее требовательными к количеству и качеству данных и повышают безопасность — ИИ должен генерировать безопасный контент и быть устойчивым к провокациям.
Осваивать ИИ в формате экспериментов и пилотов. Чтобы быть готовым к приходу действительно полезных решений, нужно следить за технологией, пробовать её и формировать компетенции. Как и с цифровизацией: вместо прыжка в дорогие решения — поиграть с бюджетными или бесплатными инструментами. К моменту прихода технологии в массы вы:
— будете понимать, какие требования закладывать в коммерческие решения (а хорошее ТЗ — 50% успеха);
— получите эффекты в краткосрочной перспективе, а значит, и мотивацию идти дальше;
— повысите цифровые компетенции команды, сняв ограничения и сопротивление по техническим причинам;
— исключите неверные ожидания, а значит, и лишние затраты, разочарования и конфликты.
Трансформировать общение пользователя с ИИ. Эту концепцию я закладываю в свой продукт: пользователю нужно давать готовые формы и вести по сценарию, где он просто указывает значения или отмечает пункты, а уже эту форму с корректной обвязкой (промптом) отдавать ИИ. Либо глубоко интегрировать решения в существующие ИТ-инструменты — офисные приложения, браузеры, автоответчики. Но это требует тщательной проработки поведения и запросов пользователя или их стандартизации: либо решение уже не копеечное, либо мы теряем в гибкости.
Разрабатывать узкоспециализированные модели под конкретные процессы. Как и людей, обучать ИИ всему — трудозатратно и малоэффективно. Узкоспециализированные решения на базе движков больших моделей сводят обучение к минимуму, сама модель не слишком большая, контент менее абстрактный и галлюцинаций меньше. Наглядная аналогия — люди: большего успеха добивается не тот, кто знает всё, а тот, кто фокусируется и развивается вглубь. Примеры узкоспециализированных решений:
— советник для управления проектами;
— налоговый консультант;
— советник по бережливому производству;
— чат-бот по производственной безопасности или помощник специалиста;
— чат-бот для ИТ-техподдержки.
По прогнозам Gartner, организации будут внедрять малые модели под конкретные задачи в три раза чаще, чем LLM общего назначения. О «конце гонки LLM» в 2025 году высказался и Гэри Маркус (The New Yorker): «Я не слышу, чтобы многие компании говорили, что модели 2025 года для них намного полезнее моделей 2024 года, даже несмотря на то, что они лучше по контрольным показателям».

Человечество достигло пика развития ИИ
Из практики
С галлюцинациями эффективнее бороться архитектурой, а не уговорами модели. В «Соколе» ИИ работает по формализованным сценариям, опирается на данные пользователя (RAG) и показывает, на чём основан вывод; в критичных шагах финальное слово — за человеком. Это дороже и сложнее в разработке (поиск баланса удобства и гибкости), но дешевле, чем разбирать последствия уверенной выдумки.
Резюме главы
Хотя ГИИ пока на стадии развития, потенциал у технологии большой. Да, хайп пройдёт, инвестиции снизятся, появятся вопросы к целесообразности, но технология не уйдёт. Так ещё 16 июня 2024 года Forbes опубликовал статью «Зима искусственного интеллекта: стоит ли ждать падения инвестиций в AI».

Зима искусственного интеллекта: стоит ли ждать падения инвестиций в AI
В ней — аналитика циклов «зимы» и «лета» ИИ и мнения Марвина Минского и Роджера Шанка, которые ещё в 1984 году на встрече ассоциации AAAI описали механизм-цепную реакцию, ведущую к новой зиме:
— Этап 1. Завышенные ожидания бизнеса и публики не оправдываются.
— Этап 2. СМИ начинают выпускать скептические статьи.
— Этап 3. Агентства и бизнес снижают финансирование исследований.
— Этап 4. Учёные теряют интерес, темп развития замедляется.
Прогноз сбылся: в течение пары лет наступила ИИ-зима, а потеплело лишь в 2010-х. Сейчас мы на очередном пике — он наступил в 2023-м после выхода ChatGPT (поэтому в книге я часто привожу примеры из этой LLM — частный, но очень понятный случай ИИ). Далее статья применяет цикл Минского и Шанка к текущей ситуации.
Этап 1. Ожидания. Революции от ИИ в повседневной жизни пока не случилось: Google так и не трансформировал поиск (Search Generative Experience получил смешанные отзывы); голосовые ассистенты («Алиса», «Маруся») стали лучше, но им вряд ли можно доверить ответственные решения; чат-боты поддержки по-прежнему плохо понимают запрос и раздражают ответами невпопад.
Этап 2. Реакция СМИ. По запросу «AI bubble» поиск выдаёт пессимистичные заголовки: «Пузырь хайпа вокруг ИИ сдувается» (The Washington Post), «От бума до взрыва: пузырь AI движется только в одном направлении» (The Guardian), «Известный экономист предупреждает, что пузырь AI рушится» (Business Insider). Моё мнение: эти статьи недалеки от истины. Рынок перегрет — это факт, и к середине 2026 года он на грани сдутия; ситуация действительно напоминает канун краха доткомов. Но перегрев — в ожиданиях и оценках, а не в полезности технологии: те, кто научился внедрять, уже видят эффекты и растут. Волна хайпа схлынет, многие обанкротятся — и это нормальный этап взросления индустрии: останутся жизнеспособные решения и компании, а массовый рынок наконец научится внедрять. Так было с интернетом после доткомов — так будет и с ИИ (подробнее — в Главе 23 и Постскриптуме).
Этап 3. Финансирование. Несмотря на пессимизм, нельзя сказать, что финансирование снижается: крупнейшие ИТ-компании продолжают вкладывать миллиарды, а ведущие конференции получают рекордное число заявок. Значит, мы сейчас между вторым и третьим этапом перехода к зиме. Но неизбежна ли «зима»? На самом деле нет.
Ключевой аргумент статьи: ИИ слишком глубоко проник в нашу жизнь, чтобы началась новая зима:
— системы распознавания лиц в телефонах и метро используют нейросети для идентификации;
— переводчики вроде Google Translate сильно выросли в качестве, перейдя от классической лингвистики к нейросетям;
— современные системы рекомендаций используют нейросети для моделирования предпочтений.
Особенно ценно мнение, что потенциал слабого ИИ не исчерпан и, несмотря на все проблемы сильного ИИ, он может приносить пользу, — полностью согласен. Следующий шаг развития ГИИ — более новые и лёгкие модели, которым нужно меньше данных для обучения. Нужно лишь набраться терпения и постепенно изучать инструмент, формируя компетенции, чтобы потом использовать его потенциал в полной мере.
Ключевые выводы
— Генеративный ИИ на передовых моделях экономически пока тяжёл, а компактные специализированные модели часто не уступают передовым в прикладных задачах.
— Чат-бот без эксперта не даёт ценности, а галлюцинации требуют перепроверки: ИИ — ассистент, а не заменитель человека.
— Закат технологии не грозит, но и уповать на неё, сокращая людей, преждевременно — нужно осваивать через эксперименты.
Что с этим делать: Пробуйте ИИ лично — на своих задачах, в бесплатных или бюджетных сервисах: это самый дешёвый способ понять технологию. А в компании начинайте с готовых решений — по данным MIT, пилоты на внешнем решении с доработкой под задачу доходят до эксплуатации вдвое чаще собственных разработок, примерно 67% против 33%. Не сокращайте людей под GenAI и вкладывайтесь в хорошее ТЗ.
Вопрос для рефлексии: Какой ваш процесс выиграет от узкой генеративной модели уже сейчас?
Глава 5. Большие языковые модели (LLM)
В середине 2026 года, 9 из 10 ИИ-проектов базируются на больших или средних языковых моделях. Давайте разберёмся в этом направлении.
Феномен LLM
2023 год в истории ИИ можно назвать эпохальным: на рынке появились LLM коммерческого качества, доступные всем. Их особенность в том, что они обучены изначально и предобучены. Порог входа в мир ИИ резко снизился — если раньше требовались команды и обученные люди, то теперь любой из нас может запрашивать аналитику, строить графики, автоматизировать рутину.
Главный бонус — предобученность: это готовые модели, в которые можно загружать массивы данных и работать с ними; их можно подключать к базам данных компании (ниже поговорим про RAG). По сути, ИИ меняет подход к аналитике: в ряде задач можно уйти от построения сложных и дорогих моделей в пользу LLM — для аналитики, отчётов с графиками и консультаций.
Простыми словами
LLM (большая языковая модель) — программа, которая училась на огромной библиотеке текстов и теперь «продолжает» любой текст, угадывая следующее слово. Угадывает настолько хорошо, что получается осмысленный ответ, письмо или план.
Что такое RAG?
Одна из технологий, которая внесла огромные изменения в мир LLM, — RAG. По сути, это «внутренний факт-чекер» для ИИ. Когда мы спрашиваем модель о курсе валют или текущей дате, сама по себе она этого не знает, но может обратиться к внешним источникам и получить актуальные данные. Основные компоненты RAG:
— Retrieval (поиск): ИИ ищет данные в надёжных источниках — базах данных и документах, к которым подключён;
— Augmentation (обогащение): ИИ добавляет найденную информацию к запросу;
— Generation (генерация): ИИ формирует конечный ответ.
То есть сначала ИИ сканирует источники, описывает для себя, о чём каждый из них, а затем использует их для подготовки ответов. Яркий пример — RAG в банке для заполнения кредитной заявки: менеджер обращается к ИИ, идёт запрос в кредитное бюро, параллельно проверяются внутренние данные. Так же и в любом направлении бизнеса — подключение к базам 1С, системе документооборота; самый простой пример — загрузка документов в условный ChatGPT или DeepSeek. Важно: использование RAG и включение в ответ ссылок на источники — одна из механик, позволяющих «проверять» ИИ и снижать уровень галлюцинаций.
Простыми словами
RAG — экзамен с открытой книгой: модель не вспоминает ответ «наизусть», а сначала находит нужную страницу в ваших документах и отвечает по ней. Поэтому качество ответа зависит от порядка в вашей «библиотеке».

Из практики
RAG — рабочая лошадка корпоративных ИИ-решений. В «Соколе» именно RAG позволяет отвечать по проектам и заметкам конкретной компании, а не по «средней температуре интернета». Правило из практики: качество такой системы определяет не модель, а порядок в базе знаний — мусор на входе даёт уверенный мусор на выходе.
Fine-tuning
Ещё один инструмент современных моделей — дообучение (fine-tuning). Например, модели можно «скормить» ваши письма и документы, чтобы она отвечала в принятом у вас стиле. Если интересно глубже, рекомендую статью по QR-коду и ссылке.

Retrieval-Augmented Generation (RAG): глубокий технический обзор
Архитектура решений на основе LLM и текстовые инструкции как слой управления качеством на уровне внедрения подробно разобраны в книге «ИИ-2. Практическое руководство» (Глава 15).
Простыми словами
Дообучение (fine-tuning) — курсы повышения квалификации: модель не переучивают с нуля, а «натаскивают» на ваших примерах, чтобы она писала в вашем стиле и знала вашу специфику.
Как работает LLM?
Вся работа современных LLM-систем строится на простом алгоритме.
— Получение запроса. Работа начинается с отправки запроса — промпта.
— Токенизация. Модель разбивает запрос на множество «токенов». Например, «Привет!» может делиться на «привет» и»!». Разные модели токенизируют по-разному, и от этого во многом зависит качество.
— Обработка. Модель обрабатывает токены в сложной математической модели, ища смысловые сочетания (вероятности); здесь же может использоваться RAG для актуальных данных.
— Подготовка ответа. ИИ строит ответ последовательно, предсказывая каждое следующее слово.

Проблема в том, что если модель ошиблась в одном месте, дальше вся логика пойдёт по неверному пути. Поэтому нет смысла переубеждать ИИ — спорить и давить. Либо начните заново, либо задайте открытый вопрос с критерием, который заставит модель пересобрать рассуждение целиком, — об этом в Главе 6.
Ещё одно понятие, которое пригодится вам на практике, — контекстное окно. Это объём информации, который модель «держит в голове» в рамках одного диалога: ваши сообщения, её ответы, загруженные документы и служебные инструкции сервиса. Всё это складывается в одну «оперативную память» разговора.
Размер окна измеряется в токенах — тех самых кусочках слов, на которые модель режет текст. У массовых моделей 2026 года окна — от ста с небольшим тысяч до миллиона токенов. В переводе на житейское: сто тысяч токенов — это порядка двухсот страниц текста, то есть целая книга вроде той, что вы держите в руках. Миллион — небольшая книжная полка. Кажется, что много. Но окно съедают не только ваши реплики: ответы модели обычно длиннее ваших сообщений, а один загруженный отчёт может стоить как половина книги. Плюс добавим сюда внутренние рассуждения модели.
Главный подвох в другом: качество падает задолго до формальной границы. Чем плотнее заполнено окно, тем хуже модель держит нить — она начинает терять середину разговора, путать договорённости, переспрашивать то, что вы уже обсудили. Знакомый эффект «к сотому сообщению ассистент отупел» — это не деградация модели, а переполнение окна. По моему опыту, ориентир такой: заполнили примерно 40% окна — пора переезжать. Перенесите накопленное в файл и начните новый чат. Точную цифру заполнения сервисы обычно не показывают, поэтому проще по признакам: модель переспрашивает, повторяется, путает имена и вводные — значит, порог пройден.