Kitabı oxu: «Как договориться с нейросетью - практическое руководство для начинающих»
Вступление
Нейросеть не читает мысли. Но с ней можно договориться
Представьте вполне обычную ситуацию. Вы впервые открываете нейросеть, находите строку ввода и пишете:
Создай красивый старинный замок.
Проходит несколько секунд. На экране действительно появляется замок: башни, стены, флаги, солнце над горами. Вроде бы всё на месте. Только это совсем не то, что вы представляли.
В вашей голове стояла тяжёлая северная крепость из почти чёрного камня. Снег лежал на разрушенных стенах. Ветер гнал по дороге мелкую ледяную пыль. Над башнями висело низкое серое небо. В окнах не было ни одного огня. А нейросеть показала почти сказочный дворец на зелёном холме.
Первая мысль предсказуема: «Она меня вообще не понимает». А потом приходится признать несколько неприятную вещь: нейросеть сделала примерно то, о чём её попросили. Вы сказали «замок» — замок есть. Сказали «старинный» — он выглядит старинным. Сказали «красивый» — с точки зрения модели он вполне может быть красивым. Про север, снег, чёрный камень, разрушенные башни и отсутствие света в окнах вы не сказали ничего. Всё это существовало только в вашей голове.
С этого момента и начинается настоящая работа с искусственным интеллектом. Не с поисков «секретного промта». Не с подписки на пять сервисов. И даже не с изучения многочисленных настроек. Она начинается с простой мысли: нейросеть не видит мою идею так, как вижу её я. Значит, мне нужно научиться эту идею объяснять.
Именно об этом эта книга. Она предназначена не для инженеров по машинному обучению, а для обычного человека, который хочет получить от нейросетей практическую пользу: написать и отредактировать текст, создать изображение, придумать постоянного персонажа, сделать музыкальную композицию, подготовить видеоролик или разобраться в документе.
Наша цель — не бесконечно нажимать кнопку «Создать», надеясь, что на двадцатый раз случайно получится хорошо. Гораздо полезнее понимать, почему результат получился именно таким, что в нём удалось и какую инструкцию нужно изменить.

Рисунок 1. Хороший результат часто рождается не из одного идеального промта, а из нескольких понятных уточнений.
Не нужно становиться программистом
Если открыть серьёзную литературу об искусственном интеллекте, довольно быстро появятся параметры, векторы, функции активации, архитектуры моделей и множество других терминов. Всё это важно для специалистов, которые создают сами системы. Но человеку, который хочет написать статью, сделать обложку или собрать короткий клип, необязательно начинать именно с этого.
Представьте автомобиль. Чтобы уверенно ездить по городу, водитель должен понимать назначение руля, педалей, зеркал и приборов. Но ему не требуется сначала научиться рассчитывать процессы сгорания топлива в цилиндрах. С нейросетями похожая история: для начала нужно знать возможности, ограничения и способы постановки задачи.
Не нужно сразу писать идеальный промт
Есть ещё одно заблуждение, которое мешает новичкам: будто где-то существует идеальная формулировка, которую надо придумать заранее. На практике работа чаще выглядит так: запрос, результат, уточнение, новый результат, ещё одно уточнение и только потом готовый вариант.
Это не признак плохой работы. Наоборот, так выглядит нормальный диалог с инструментом, который умеет учитывать контекст и ваши последующие замечания.
Важное замечание
Возможности нейросетей, интерфейсы и правила конкретных сервисов меняются быстро. Поэтому в книге почти нет инструкций вида «нажмите кнопку X». Мы будем говорить о принципах, которые переживают смену интерфейсов. Там, где речь идёт о праве, здоровье, безопасности, финансах или правилах конкретной платформы, воспринимайте книгу как общий ориентир, а не как замену актуальному первоисточнику или профессиональной консультации.
Есть и ещё одна тема, которую нельзя честно обойти. Современные нейросети позволяют синтезировать голоса, создавать реалистичные изображения, писать убедительные тексты и автоматизировать сложные действия. Поэтому вместе с вопросом «Как это сделать?» рано или поздно появляются два других: «Имею ли я право это делать?» и «Стоит ли мне это делать?». К этому разговору мы придём ближе к концу книги.
Часть I. Первый разговор с нейросетью
Глава 1. Что перед нами вообще находится
Есть простой эксперимент. Закончите фразу:
Зимой на улице часто идёт...
Скорее всего, вы подумали о снеге. Для этого вам не пришлось открывать энциклопедию или проводить логическое доказательство. Связь между зимой и снегом настолько привычна, что продолжение возникает почти автоматически.
Современная языковая модель устроена несравненно сложнее, но для первого знакомства полезна идея закономерностей. Во время обучения модель анализирует огромное количество примеров и учится находить связи между элементами данных. В тексте — между словами, фразами, понятиями и структурами. В изображениях — между объектами, формой, цветом, композицией и описанием. В музыке — между ритмом, гармонией, тембром, голосом и строением композиции. В видео ко всему этому добавляется изменение во времени.
После обучения модель способна создавать новый результат, используя выученные закономерности. Именно поэтому языковая система пишет, генератор изображений рисует, музыкальная модель создаёт звук, а видеомодель формирует последовательность кадров.
Здесь возникает первая важная ловушка. Мы привыкли воспринимать уверенный человеческий ответ как признак знания. Нейросеть способна написать что-нибудь совершенно уверенно, даже если ошибается.
Очень убедительная выдумка
Представим, что мы просим:
Придумай историю вымышленного города Нордхольм.
Через несколько секунд появляется вполне правдоподобный город: год основания, старый промышленный район, ратуша, легенда о местном озере и даже фамилия первого мэра. Всё хорошо — мы сами попросили фантазию.
Через десять сообщений спрашиваем:
А что произошло в Нордхольме в 1912 году?
Модель может продолжить созданную историю. Для художественного мира это прекрасное качество. Для исторического исследования — проблема. Поэтому первое правило стоит запомнить сразу: правдоподобный ответ и достоверный ответ — не одно и то же.
Нейросеть не обязана быть поисковиком
Языковая модель может работать вместе с поиском или подключёнными источниками, а может отвечать только на основе уже имеющегося контекста и своих внутренних закономерностей. Пользователю важно различать эти ситуации. Когда точность факта существенна, нужно понимать, откуда взялся ответ и можно ли его проверить.
Для творческой задачи свобода модели — преимущество. Для фактической — иногда источник риска. Один и тот же механизм может быть полезен или опасен в зависимости от того, что вы от него хотите.
Полезная привычка: отделяйте знание от предположения
Когда вопрос фактический, можно заранее попросить модель разделить ответ на то, в чём она уверена, и то, что требует проверки. Это не превращает ответ в истину, но помогает заметить зоны неопределённости. Например: «Сначала дай краткий ответ. Затем отдельно перечисли утверждения, которые стоит проверить по источникам». Такой запрос особенно полезен, если тема новая для вас и вы сами пока не знаете, где могут скрываться ошибки.
Не менее важно различать генерацию и поиск. Если модель придумывает рекламный слоган, ей не нужен источник. Если она сообщает сегодняшнюю цену, свежие правила сервиса или содержание конкретного документа, задача уже требует актуальных данных. Одна из частых ошибок новичка — использовать одинаковый уровень доверия к творческой фантазии и к сведениям о реальном мире.
Мини-практика
Задайте модели два вопроса подряд: «Придумай три причины, по которым жители вымышленного города покинули его» и «Назови три реальные причины эвакуации жителей города N в конкретном году». Сравните ответы. В первом случае оригинальность важнее проверки. Во втором — наоборот. Попробуйте своими словами объяснить, почему это две разные задачи, хотя внешне обе выглядят как просьба перечислить причины.
Глава 2. Сначала решите, что вам нужно
Новички часто начинают одинаково: видят рекламу нового сервиса, регистрируются, смотрят на множество кнопок и только потом спрашивают: «Что здесь вообще можно сделать?» Подход понятный, но не самый удобный.
Лучше идти с противоположной стороны: сначала решить, какой результат нужен, а уже потом выбирать инструмент.
Большой проект почти всегда состоит из маленьких задач
Представим, что вы решили выпустить песню и небольшой клип. На словах задача одна. На деле нужно придумать тему, написать текст, определить музыкальный стиль, получить композицию, создать обложку, подготовить образ исполнителя, сделать несколько видеосцен, смонтировать их и написать описание публикации.
Здесь вовсе не обязательно использовать одну нейросеть. Языковая модель поможет с идеей и текстом, музыкальная — с песней, генератор изображений — с обложкой, видеомодель — со сценами. Потом вы снова можете вернуться к языковой модели, чтобы подготовить описание.
Очень быстро выясняется важная вещь: лучшей нейросети вообще не существует. Существует наиболее подходящий инструмент для конкретной работы.