Kitabı oxu: «Искусственный интеллект без сложных слов»
Введение. Зачем разбираться в искусственном интеллекте
Разные истории об одной технологии
Представьте, что вам прислали запись разговора на незнакомом языке. Хочется понять, о чем говорят участники и есть ли там что-нибудь важное для вас. Современные инструменты могут помочь получить расшифровку, перевод и краткое содержание. Эти функции иногда объединены в одном приложении, хотя решают разные задачи. Расшифровка сохраняет слова, перевод передает их смысл на другом языке, а краткое содержание отбирает главное. Если понадобится точная цитата, одного пересказа будет мало.
За одним словом «ИИ» скрывается множество таких различий. Система, которая распознает речь, и система, которая создает изображение, могут быть полезны одному человеку, но отвечают за разные потребности. Понимание этих различий помогает увидеть, какая именно помощь доступна и что остается сделать самому.
Книга поможет связать эти разрозненные представления. Мы познакомимся с основными видами ИИ, посмотрим на их применение и разберемся, какие вопросы возникают при встрече технологии с различными задачами. Для такого знакомства не нужны знания программирования. Достаточно любопытства и желания понять, о чем именно говорят, когда очередному инструменту приписывают почти неограниченные возможности.
Понимать возможности
Первая проба ИИ бывает интересной, но сама по себе еще не объясняет, какое место ИИ-инструмент может занять в жизни. Для знакомства с темой полезно увидеть, какие потребности удовлетворяют разные системы.
Одни помогают найти или упорядочить сведения. Другие предлагают варианты текста, изображения или звука. Третьи встраиваются в работу специалиста и выполняют отдельную часть сложного процесса. За пределами пользовательских приложений есть задачи исследований, производства и управления физическими устройствами.
Область применения многое говорит и о результате. Краткое содержание помогает решить, стоит ли читать документ целиком. Визуальный эскиз позволяет обсудить идею до большой работы над оформлением. Объяснение незнакомого термина облегчает дальнейшее чтение. Во всех трех случаях человек получает новую опору для собственного действия, хотя ни один результат сам по себе не завершает всю его работу.
Важны и различия между продуктами. За похожими окнами диалога могут стоять разные модели и наборы функций. Один сервис предназначен прежде всего для разговора, другой связывает ответы с выбранными материалами, третий дает больше возможностей для определенного вида творчества. Поэтому вопрос «какая нейросеть лучше?» приобретает смысл, когда понятно, для чего она нужна конкретному человеку.
Знакомые названия полезны как ориентиры, но могут скрывать перемены: в приложении появляются новые функции, меняются условия доступа и способы работы. Поэтому мы будем связывать конкретные продукты с их назначением. Так легче разобраться и в инструменте, которого еще не существовало в момент выхода книги.
Что меняется в обычной жизни
Необязательно планировать новую профессию, чтобы заинтересоваться ИИ. Возможно, вам хочется лучше понимать новости, помогать ребенку ориентироваться в новых инструментах или разобраться, почему привычные программы начинают предлагать все больше помощи. Можно читать эту книгу и без намерения немедленно что-нибудь автоматизировать.
Представим простую ситуацию: человек хочет попробовать видео-творчество, но пока не знает, что ему ближе - придумать историю, снять материал, смонтировать его или создать отдельные сцены с помощью модели. Обзор возможностей помогает различить эти занятия и увидеть, какие знания потребуются для каждого из них.
Та же логика работает в других областях. Знакомство с помощниками для программирования позволяет понять, что меняется в создании программ. Обзор языковых инструментов показывает новые возможности общения и учебы. Рассказ об исследованиях помогает увидеть работу, которая обычно остается за пределами пользовательского чата. Широта картины здесь важна: интересующая вас возможность может оказаться совсем не той, с которой началось знакомство.
В книге будут короткие ситуации, сопоставления и подтвержденные случаи применения. Условные примеры будут обозначены; для исследований мы укажем условия их проведения и ограничения выводов. Разговор о пользе имеет смысл связывать с конкретной работой: результаты одной системы на разных задачах могут различаться.
Настоящее и недалекое будущее
Разговор об ИИ почти сразу становится разговором о будущем. Если система умеет создавать текст, возникает вопрос о работе авторов. Если она помогает объяснять учебный материал - о роли преподавателя. Если выполняет часть профессиональных действий - о том, как изменится профессия. Эти вопросы естественны, но между возможностью программы и переменой в жизни людей лежит длинный путь.
Нужно понять, насколько устойчиво работает инструмент, в каких условиях его можно применять, кто будет отвечать за результат и как изменится сам процесс. Значение имеют стоимость, доступ к данным, привычки организаций и готовность людей доверить системе определенные действия. Техническая демонстрация отвечает только на часть этих вопросов.
Поэтому мы будем различать уже существующее применение, наблюдаемое направление развития и предположение о будущем. Например, создание отдельного материала и длительная самостоятельная работа над проектом предъявляют разные требования к системе. Улучшение одной способности не означает, что все остальные трудности решены. В то же время сегодняшнее ограничение не обязательно останется неизменным.
Для будущего возможны разные пути. Помощники могут постепенно становиться обычной частью программ, которыми люди уже пользуются. В некоторых областях может расширяться круг действий, которые они выполняют самостоятельно. В других внедрение способно идти медленнее из-за цены ошибки, нехватки данных или сложности организации работы. Мы рассмотрим основания таких предположений и обстоятельства, которые могут изменить направление событий.
Рассмотрение нескольких путей позволяет замечать реальные изменения и пересматривать собственное мнение. Отношение к конкретной системе может зависеть от того, где и для чего ее предлагают использовать.
Маршрут по книге
Первые главы дадут необходимую основу. Мы посмотрим, где ИИ встречается в повседневности, как системы учатся и почему их ответы бывают полезными и ошибочными. Затем составим карту инструментов: универсальные помощники, поиск, специализированные творческие сервисы, функции внутри привычных программ и системы, которым поручают конкретные действия.
Следующая часть посвящена применению. Информация и тексты, изображения и видео, голос и музыка, привычная работа, учеба и личные занятия - в каждой области нас будет интересовать человеческая потребность. Отдельная глава выйдет за пределы чата к программированию, науке, производству и физическому миру.
Затем мы обсудим основания доверия и возможные последствия распространения ИИ. Почему уверенная форма ответа не равна достоверности? Как меняется отношение к авторству? Что происходит с отдельными трудовыми задачами и способами обучения? Какие направления развития выглядят обоснованными и что им препятствует? Последние главы помогут связать технологические возможности с этими более широкими вопросами.
Книгу можно читать последовательно или после первых глав перейти к особенно интересующей области. Для знакомства с видеосистемами не потребуется сначала освоить программирование. Для понимания перемен в образовании не придется учиться создавать музыку. Короткие примеры будут помогать увидеть суть; подробное обучение отдельному инструменту останется следующим возможным шагом.
К концу чтения у вас появятся ориентиры для самостоятельного знакомства с темой. Вы сможете точнее понимать новости, различать назначения сервисов и выбирать то, что заслуживает именно вашего внимания. Возможно, захочется попробовать новый способ работы или творчества. Возможно, важнее окажется ясное представление о переменах вокруг. В обоих случаях знакомство с ИИ начнется с понимания собственных интересов и возможностей технологии.
Глава 1. Искусственный интеллект уже рядом
Много задач под одним названием
Представьте, что на телефоне хранится множество семейных фотографий. Вы помните снимок: ребенок стоит у воды с красным воздушным змеем. Когда он сделан и в какой папке лежит, уже забыли. Перелистывать тысячи кадров долго, а названия файлов ничего не говорят об их содержании. Поиск по тому, что изображено на снимке, меняет саму задачу: искать можно знакомыми словами, даже если никто заранее не подписал каждую фотографию.
Подобная возможность кажется естественной, пока не сравнишь ее с поиском по дате. Дата записана в свойствах файла, ее достаточно прочитать и сопоставить с запросом. Для поиска по содержанию нужно связать цифровое изображение с предметами и признаками, которые человек описывает словами. Поиск по сочетанию признаков описан, например, для Google Photos. Это не обещает, что условный снимок из нашего примера обязательно найдется, но показывает само направление: искать в неподписанной коллекции по тому, что на снимках.
Так устроено немало повседневных встреч с ИИ. Он может не представляться собеседником и не предлагать написать ему сообщение. Человек замечает, что стало проще найти нужное, разобрать запись или выбрать среди множества вариантов. Название технологии при этом может вообще не появляться на экране.
Слово «интеллект» располагает к гораздо более широким ожиданиям. Мы связываем его с умением понимать ситуацию, переносить опыт, рассуждать о последствиях и менять цель. Когда программа успешно выполняет сложное действие, хочется приписать ей весь этот набор сразу. Но способность находить предмет на фотографии еще ничего не говорит о способности проверить документ или объяснить поступок человека. Для каждой следующей задачи нужны свои основания считать систему пригодной.
Поэтому в начале знакомства полезно смотреть на три вещи: какие сведения поступают в систему, какой результат она выдает и для чего этот результат используется. На входе может быть изображение, звук, история заказов или текст. На выходе: распознанная фраза, выбранный материал, прогноз числа покупателей, созданная иллюстрация. Такое описание многое проясняет еще до разговора о техническом устройстве.
В определении Организации экономического сотрудничества и развития - ОЭСР - среди результатов работы систем ИИ перечислены прогнозы, содержание, рекомендации и решения. Они могут влиять на физическую или виртуальную среду. Это только часть определения: в нем учитываются также способ получения результата, цели системы, самостоятельность ее работы и способность изменяться после внедрения. Для нас пока важен сам перечень результатов: разговор здесь явно шире, чем общение в чате.
При этом не всякая полезная автоматическая функция относится к ИИ. Если будильнику задано сработать в семь утра, для этого достаточно обычного правила. Когда таблица складывает числа по формуле, ей не требуется распознавать намерение автора. В программе могут соседствовать такие действия и компоненты ИИ. Например, распознавание голосовой просьбы и последующее включение заранее заданного таймера - разные части одной удобной функции.
Провести границу по внешнему виду бывает трудно. Наличие голоса, анимации или дружелюбных реплик само по себе ничего не доказывает. Столь же неверно считать обязательным признаком ИИ отсутствие заранее заданных правил: в этой области существуют подходы, использующие явно представленные знания и логику. Мы еще разберем, чем они отличаются от обучения на данных. Пока достаточно помнить, что название на упаковке не объясняет устройство продукта.
Польза зависит и от того, как части системы соединены. Модель - это компонент системы ИИ, с помощью которого она, например, распознает речь или делает прогноз. Распознанные слова еще нужно передать нужному приложению, результат поиска - показать в удобной форме, найденную ошибку - показать сотруднику, который может ее исправить. Даже сильная модель может оказаться неудобной в плохо организованном продукте. И наоборот, незаметная функция с узкой задачей способна приносить ежедневную пользу, если появляется в нужный момент и дает понятный результат.
За выражением «ИИ умеет» всегда стоит уточнение: какая система, в каких условиях и какое действие выполняет. Рассмотрим несколько таких действий.
Распознавать и находить закономерности
На бумажном объявлении указаны адрес и время встречи. Человек видит буквы и читает сообщение. Для устройства фотография объявления прежде всего представляет собой изображение. Чтобы превратить надпись в текст, с которым можно работать дальше, нужно распознать символы и их расположение. После этого адрес можно скопировать, фразу - перевести, дату - использовать в другой программе.
Сфотографировать объявление и получить из него текст это две разные задачи. В первом случае надпись сохранена, во втором ее можно использовать, не перепечатывая. Например, функция Apple Live Text позволяет копировать распознанный текст с фотографий. Ее доступность зависит от устройства и языка. Необычный шрифт, блик и неразборчивый фрагмент способны осложнить распознавание.
С голосом происходит похожее преобразование. Звуковая запись должна стать последовательностью слов. Такая расшифровка помогает искать нужное место в разговоре, читать выступление или знакомиться с материалом, когда прослушивание неудобно. Польза возникает уже при смене формы: информация, доступная только через звук, становится текстом, который можно быстро просмотреть.
Однако устная речь не состоит из одинаково четких слов, произнесенных в тишине. Люди перебивают друг друга, сокращают фразы, употребляют имена и специальные термины. Поэтому внешне аккуратная расшифровка может скрывать сомнительное место. Если система выбрала другое слово, предложение иногда остается грамматически правильным, но приобретает иной смысл. Точность нужно оценивать на записях, похожих на те, с которыми предстоит работать: именно так рекомендует поступать, например, документация Google Cloud по распознаванию речи.
При распознавании изображений результатом нередко становится всего лишь категория. В условной задаче сортировки система может отнести снимок к изображениям животных, определить вероятное наличие собаки или выделить область, где находится нужный предмет. Каждый следующий вариант решает немного другую задачу. Одно дело - сказать, что предмет присутствует, другое - показать его положение, третье - найти среди тысяч фотографий похожий объект.
Человек объединяет подобные действия почти незаметно. Он видит собаку, замечает поводок, предполагает, что животное ведут на прогулку. У программы может быть только узкая функция распознавания. Отметка «собака» не означает, что система поняла намерения хозяина или установила, что происходило за границами кадра. Это различие помогает оценивать конкретную пользу без лишних ожиданий.
Распознавание может поддерживать и профессиональное внимание. Представим линию, на которой выпускают одинаковые детали. На изображениях нужно замечать царапины или отклонение формы. Система компьютерного зрения способна выделять подозрительные участки для дальнейшего рассмотрения. Такой пример объясняет назначение технологии; реальные требования зависят от изделия, освещения, камеры и допустимых дефектов.
Здесь появляются два разных вида ошибок. Можно пропустить поврежденную деталь, а можно направить на дополнительную проверку исправную. Последствия различаются, поэтому «хорошо распознает» всегда нуждается в уточнении. Для одной задачи особенно важно ничего не пропустить, для другой чрезмерное число ложных сигналов сделает работу неудобной и низкоэффективной. Универсальная похвала точности не заменяет понимания того, что конкретно система должна замечать и определять.
Рядом с распознаванием находится поиск закономерностей и необычных случаев. Допустим, датчик на оборудовании передает измерения. Изменение привычного рисунка показаний может стать поводом обратить внимание на устройство. Сигнал еще не объясняет причину: возможны неисправность, изменение режима или проблема самого датчика. Но он помогает выбрать, куда направить усилия человека.
Во всех этих ситуациях человеку становится доступна информация, которую было трудно извлечь или просмотреть. Для такой помощи системе вовсе не обязательно поддерживать беседу.