Введение: два взгляда на одну реальность
Когда мы смотрим на фотографию, мы видим лица, формы, цвета. Нейросеть — видит только числа. Для неё изображение — это огромная матрица яркостей пикселей, которую нужно математически обработать. Но и человеческий мозг, как выясняется, тоже не просто «фотографирует» реальность. Он активно дорисовывает, раскрашивает и исправляет картинку, используя собственные нейронные сети. В этой статье мы сравним, как устроено зрение у человека и у искусственного интеллекта, и покажем, что общего между работой мозга и алгоритмами компьютерного зрения.
Человеческое зрение: нейросеть внутри нас
Мозг человека — это биологическая нейронная сеть, которая обрабатывает визуальные сигналы со скоростью 30–60 «генераций изображений» в секунду. При этом мы не замечаем, что исходное изображение на сетчатке перевёрнуто, размыто по краям и содержит слепое пятно. Мозг исправляет все эти искажения: переворачивает картинку, заполняет пробелы, убирает тени от сосудов сетчатки и синтезирует чёткое цветное изображение из фрагментов, собранных быстрыми движениями глаз (саккадами). Эксперименты показывают, что для полного восприятия незнакомого изображения человеку нужно около 1/60 секунды, а мерцание может ощущаться вплоть до 180–250 Гц.
Компьютерное зрение: как ИИ «видит» числа
Для компьютера изображение — это трёхмерный массив чисел (высота × ширина × цветовые каналы). Обрабатывать такой объём данных напрямую невозможно, поэтому используются свёрточные нейронные сети (CNN). Они работают в три этапа:
- Свёртка: сеть сканирует изображение маленькими фильтрами, ища простые признаки: границы, углы, линии.
- Пулинг (субдискретизация): сеть сжимает карту признаков, оставляя только самые важные значения, чтобы уменьшить объём данных и избежать переобучения.
- Полносвязный слой: на основе набора абстрактных признаков («тут круг», «тут резьба») сеть выдаёт окончательный вердикт — например, «это болт М6».
Такая архитектура позволяет нейросети отличать гайку от болта за миллисекунды и работать быстрее и внимательнее человека на задачах контроля качества.
Слепое пятно и дорисовка реальности: общая черта
У человека есть слепое пятно — место, где зрительный нерв покидает сетчатку. Мы его не замечаем, потому что мозг дорисовывает недостающую область, используя информацию от второго глаза или окружающих участков. Если закрыть один глаз и медленно поднести карандаш к зоне слепого пятна, его кончик исчезнет — но только если задержать его там дольше чем на секунду. Мозг использует динамический буфер, который быстро истощается.
Интересно, что нейросети тоже могут «дорисовывать» изображения — например, при помощи генеративно-состязательных сетей (GAN) или алгоритмов inpainting. Однако их подход чисто математический: они предсказывают недостающие пиксели на основе обучающей выборки, а не на основе контекста второго глаза.
Цвет и резкость: саккады против свёрток
Человек видит чётко и в цвете только в центральной области сетчатки — макуле. Всё остальное поле зрения размыто и почти чёрно-белое. Чтобы создать иллюзию полной картинки, глаз совершает быстрые непроизвольные движения — саккады — несколько раз в секунду. Мозг собирает фрагменты в единое целое. Если пристально смотреть в одну точку, саккады подавляются, и через некоторое время цветовая информация «застывает» в буфере — можно наблюдать оптическую иллюзию, когда чёрно-белое изображение кажется цветным.
Нейросети, напротив, не нуждаются в движении. Они обрабатывают всё изображение целиком, но с разным разрешением на разных слоях свёртки. Ранние слои видят мелкие детали (границы, текстуры), а глубокие — абстрактные признаки (формы, объекты). Это напоминает иерархию обработки в зрительной коре мозга.
Тени сосудов и «искры из глаз»: артефакты восприятия
Сосуды сетчатки отбрасывают тени на фоторецепторы, но мы их не замечаем — мозг выравнивает яркость. Однако при взгляде на яркий источник света можно временно увидеть инвертированное изображение сосудистой сети (белые сосуды на тёмном фоне). А если резко встать, можно заметить яркие точки, движущиеся по сложным траекториям — это иммунные клетки (макрофаги), путешествующие по сосудам сетчатки. В обычных условиях нейросеть мозга фильтрует эти помехи, но при гипоксии она временно не справляется.
В компьютерном зрении тоже есть артефакты — например, шум датчика, блики или искажения линз. Современные алгоритмы предобработки (фильтры, нормализация) удаляют их, аналогично тому, как мозг убирает тени сосудов.
Практическое применение: от контроля качества до беспилотников
Компьютерное зрение на основе нейросетей активно используется в промышленности:
- Автоматический контроль геометрии деталей на конвейере.
- Чтение маркировок и штрих-кодов даже на повреждённых этикетках.
- Проверка правильности захвата детали роботом.
Нейросети работают быстрее и внимательнее человека, особенно при монотонных задачах. Кроме того, они применяются в беспилотных автомобилях, медицинской диагностике (анализ снимков) и системах безопасности. Интересно, что многие из этих систем обучались на данных, размеченных людьми — например, через капчи, где пользователи выделяли светофоры и пешеходные переходы.
Как мы сами обучаем ИИ, не зная об этом
Каждый раз, когда вы вводите капчу с двумя словами, вы помогаете обучать нейросеть. Одно слово — защита от ботов, а второе — задача для ИИ: распознать текст из старой газеты, который люди читают с трудом. Позже капчи эволюционировали: изображения светофоров, пешеходных переходов, автобусов — всё это размечалось вручную для обучения беспилотников. Даже траектория движения курсора используется, чтобы отличить человека от машины и одновременно научить ИИ двигаться естественно.
Мы не просто пользуемся нейросетями — мы участвуем в их обучении каждый день, часто не осознавая этого.
Ограничения и риски: когда ИИ «видит» неправильно
Несмотря на впечатляющие успехи, компьютерное зрение имеет ограничения. Нейросети могут ошибаться из-за:
- Адверсарных атак: небольшие искажения пикселей, незаметные для человека, могут заставить ИИ классифицировать панду как гиббона.
- Переобучения: если обучающая выборка недостаточно разнообразна, сеть будет хорошо работать только на знакомых данных.
- Отсутствия контекста: нейросеть не понимает, что изображение — часть реального мира, она оперирует только статистическими закономерностями.
Человеческое зрение тоже не идеально — мы подвержены оптическим иллюзиям, можем не замечать изменений (слепота к изменениям) и дорисовывать детали на основе ожиданий. Однако мозг использует богатый контекст и опыт, чего пока лишены искусственные системы.
Будущее: слияние биологического и искусственного зрения
Современные исследования стремятся объединить сильные стороны обоих подходов. Например, разрабатываются нейроморфные чипы, которые имитируют работу биологических нейронов, и алгоритмы, учитывающие саккады и другие особенности человеческого зрения. Уже сегодня нейросети могут не только «видеть», но и «помнить» прошлое (рекуррентные сети), что позволяет прогнозировать движение объектов.
В перспективе возможно создание гибридных систем, где ИИ будет компенсировать недостатки человеческого зрения (например, помогать водителям замечать препятствия) или даже восстанавливать зрение людям с повреждениями сетчатки. Пока же мы только начинаем понимать, насколько сложно устроено наше собственное восприятие — и как много общего у него с алгоритмами, которые мы создаём.
Вопросы и ответы
Почему нейросеть видит мир как числа?
Для компьютера любое изображение — это матрица чисел, где каждый пиксель имеет числовое значение яркости и цвета. Нейросеть не воспринимает образы, как человек, а анализирует математические закономерности в этих числах. Она ищет повторяющиеся паттерны (границы, текстуры, формы) и на их основе классифицирует объекты.
Чем отличается человеческое зрение от компьютерного?
Человек видит мир целостно, но на самом деле мозг постоянно дорисовывает и исправляет картинку: убирает слепое пятно, тени сосудов, синтезирует цвет из фрагментов. Компьютерное зрение работает с полным изображением, но обрабатывает его поэтапно через свёртки и пулинг, выделяя сначала простые, а затем сложные признаки. Человек использует контекст и опыт, нейросеть — только статистику.
Что такое свёрточная нейронная сеть (CNN)?
Это тип нейросети, специально разработанный для обработки изображений. Она сканирует картинку маленькими фильтрами (свёртка), находит простые признаки (линии, углы), затем сжимает данные (пулинг) и на выходе выдаёт классификацию. CNN эффективны, потому что используют локальные связи и разделение весов, что снижает количество параметров.
Почему мы не замечаем слепое пятно?
Мозг автоматически заполняет область слепого пятна, используя информацию от второго глаза или окружающих участков сетчатки. Если закрыть один глаз, можно заметить исчезновение объекта в зоне слепого пятна, но только если задержать его там более чем на секунду — динамический буфер мозга быстро истощается.
Как нейросети используются в промышленности?
Основные применения: автоматический контроль геометрии деталей на конвейере, чтение маркировок и штрих-кодов, проверка правильности захвата деталей роботами. Нейросети работают быстрее и точнее человека, особенно при монотонных задачах, и могут обнаруживать дефекты, незаметные глазу.
Может ли нейросеть ошибаться в распознавании изображений?
Да. Нейросети подвержены адверсарным атакам — небольшие искажения пикселей, незаметные для человека, могут привести к неверной классификации. Также возможны ошибки из-за переобучения (если обучающая выборка узкая) или из-за отсутствия контекста, который человек использует интуитивно.
Как мы помогаем обучать нейросети, не зная об этом?
Через капчи: когда вы вводите два слова, одно из них — задача для ИИ по распознаванию текста. Позже капчи с изображениями светофоров и пешеходов использовались для обучения беспилотников. Даже траектория движения курсора помогает отличать человека от бота и учить ИИ двигаться естественно.