Фронт разработки физического ИИ — это не просто склад. Это башня из деревянных блоков «Дженга».

В промышленном помещении в Сан-Лейндо (Калифорния), занимаемом компанией Encord, ставки повышаются. Эндрю Сейя не просто играет. Он обучает машину.

Сейя — так называемый «пилот» по терминологии Encord. Проще говоря, он инструктор по робототехнике. На голове у него шлем с камерой, передающий его точку зрения. Но к шлему также прикреплено другое устройство: датчики, измеряющие его мозговые волны.

Пока он вытаскивает деревянные бруски из шаткой башни, система записывает не только визуальные данные. Она фиксирует его намерения. Его концентрацию. Точный момент ошибки.

Это не научная фантастика. Это последняя ставка в гонке за создание функциональных гуманоидных роботов.

Почему данные для физического ИИ сложнее текста

Генеративный ИИ произвел революцию в чат-ботах, потому что текстовые данные были повсюду. Можно было «спарсить» миллиарды текстовых файлов из интернета. Это стоило копейки.

Физический ИИ работает иначе.

Тренировочные данные для роботов просто не существуют в необходимом масштабе. Пока что.

Винитх Велмуруган знает это не понаслышке. Он руководит направлением обучения роботов в Encord. До этого он работал в лаборатории робототехники OpenAI и в Berkshire Grey. В Encord он пришел, потому что старая модель сбора данных перестала работать.

«Данных просто не существует», — сказал он.

Компании, создающие инструменты машинного зрения, раньше просто управляли данными. Теперь им приходится их создавать. Обучение от начала до конца требует данных о реальных манипуляциях. Одного видео недостаточно для нужной точности. Да, автомобили с автопилотом собирают собственные данные. Но масштабировать этот процесс — настоящий кошмар.

Велмуруган приводит цифру, которая должна напугать любого, кто пытается перенять экономику больших языковых моделей (LLM) для роботов. Вам нужен набор данных, примерно в пять раз превышающий весь видеоархив YouTube.

Как собрать такие объемы, не обанкротив лабораторию?

Их нужно произвести. И размечать их, используя методы нейробиологии.

Encord и Zander Labs: Измерение разума

Шлем, который носит Сейя, поставляется компанией Zander Labs. Это немецкий стартап в области нейробиологии. Они не просто наблюдают за вашими движениями. Они измеряют активность мозга, чтобы определить ментальное состояние.

Удивление. Ошибка. Намерение.

Это пилотный проект между Encord и Zander. Цель специфическая: создать начальный набор данных с маркировкой мозговых волн. Протестировать его на моделях робототехники клиентов. Увидеть, действительно ли улучшится ли производительность. Если да — масштабировать. Если нет — изменить подход.

Лукас Гёрке, нейрофизиолог в Zander, курирующий эту работу, сразу видит практическую ценность. Интенсивность мозговой активности во время задачи сообщает создателям моделей, когда роботу нужна помощь. Она отмечает моменты «высоких усилий».

Именно это Велмуруган называет «самым передним краем» технологий.

Это также дорого.

Экономика «мусорных данных от первого лица»

Большинство компаний, создающих «мозги» для роботов, полагаются на эгоцентричные данные. Рабочие надевают камеры. Выполняют задачи. Роботы наблюдают.

Encord тоже так делает. У них есть пилоты на фабриках по всему миру. Но в Сан-Лейндо они экспериментируют.

На одной из станций София Инфанте управляет роботизированными руками, подключая и отключая Ethernet-кабели от серверных стоек. Операторы дата-центров мечтают автоматизировать этот процесс. Если бы только у роботов была такая точность.

Я попробовал это сделать сам.

Это сложно.

Роботизированные захваты не обладают такой же свободой движений, как человеческие пальцы. Они неуклюжи. У Инфанте есть ловкость. У ее мозга есть микрорегулировки. Роботу нужно научиться этим регулировкам. Вот в этом и заключается разрыв.

Другой новый метод использует датчики на предплечье. Они фиксируют электрические сигналы в мышцах. Зачем? Потому что видео рук человека часто не показывает саму руку. Мешают препятствия. Ограничен угол обзора.

Датчики на руке填补няют эти пробелы. Они помогают создать 3D-карту положения руки даже тогда, когда камера ее не видит.

Но вот проблема с экономикой.

Encord размечает свои наборы данных подробно: «Правая рука затягивает болт», «Левая рука наливает кофе». Густая, детальная разметка.

Велмуруган утверждает, что такой уровень детализации в 100 раз ценнее для тренировки специфических задач, чем «мусорные данные от первого лица».生产成本 лишь в 20 раз выше. На бумаге это выгодная сделка.

Но в 20 раз больше — это все равно реальные деньги.

Создатели LM собирали текст за копейки. Физические данные требуют производства. Они требуют человеческого труда. Они требуют оборудования для нейробиологии. Экономика фундаментально нарушена по сравнению с программным обеспечением.

Кто покупает эти данные?

Encord работает с ведущими робототехническими компаниями. Велмуруган не может назвать их имена. Но они запрашивают специфические наборы данных по навыкам.

Для дообучения моделей.

На объекте Encord работают системы типа «лидер-последователь». Парные роботизированные руки. Одна движется со скоростью человека-оператора. Другая имитирует ее движения.

Задачи включают наливание кофе без проливания. Складывание покерных фишек. Сортировку искусственных цветов. Книг. Пластиковых овощей. Лотков для кошачьего туалета. Мешков с проводами.

Каждая компания, создающая гуманоидов, хочет получить эти наборы.

Велмуруган видит все это со своего места. Он находится между многими робототехническими компаниями. Он знает, что работает. Он знает, что не работает. Как стартапы, так и передовые лаборатории пытаются решить одни и те же проблемы.

Какие методы работы с данными приживутся? А какие исчезнут?

Encord замечает победителей еще до того, как клиенты осознают, что проигрывают.

Это держит пилотов занятыми.

Сейя, Инфанте — они не просто аннотаторы. Они строительные блоки. Ранее они работали в Scale, другой компании по разметке данных. Теперь они здесь: вытаскивают блоки из башен, подключают кабели, наливают кофе.

Ранее Сейя обслуживал робота-сортировщик мусора в мусороперерабатывающей компании. Технология стала для него билетом из ручного труда в автоматизированный.

Теперь он учит машины думать о складывании блоков.

«Каждый день что-то новое», — сказал он.

Башня рухнула. В очередной раз.

Датчики зафиксировали это. Модель обучилась.

Но голод на данные не исчезает. Он растет. В пять раз больше, чем YouTube. Это не проблема ближайшего будущего. Это промышленный вызов.

Станет ли маркировка мозговых волн ключом? Или это просто еще один дорогой набор датчиков, замедляющий производство?

Мы не узнаем этого, пока модели действительно не заработают.