Компания Nvidia объявила о запуске новой генеративной модели Axolotl3D, предназначенной для восстановления и редактирования трёхмерных объектов по неполным данным. В отличие от большинства современных решений, которые работают с полностью видимыми изображениями, Axolotl3D способна заполнять отсутствующие части модели, используя ограниченный набор снимков, сведения о камерах и частичное облако точек.
Как работает модель
Axolotl3D построена на основе архитектуры Hunyuan3D 2.1. На вход система принимает до шести фотографий объекта. Для извлечения визуальных признаков и оценивания положения камер используется сеть DINOv2, а облако точек обрабатывается специализированным энкодером VecSetX. Полученные данные агрегируются и передаются в диффузионный трансформер, генерирующий предварительную форму объекта. На завершающем этапе специализированный модуль ShapeVAE преобразует эту форму в готовый 3D‑меш.
Снижение эффекта галлюцинаций
Одним из ключевых элементов, помогающих модели избегать «галлюцинаций», является интеграция облака точек. Уже известная часть геометрии служит якорем, а генеративный процесс заполняет только те области, где информации мало.
Обучение и данные
Для обучения Axolotl3D использовался набор TRELLIS‑500K, включающий 407 000 трёхмерных моделей. Перед подачей в сеть модели были искусственно «повреждены»: части объектов скрывались, фрагменты облаков точек удалялись, а некоторые ракурсы исключались. Таким образом, модель обучалась восстанавливать объекты в условиях недостаточности данных.
Обучение проводилось на восьми ускорителях Nvidia A100.
Ограничения
- Модель обучалась на изображениях с фиксированными параметрами съёмки и постоянным расстоянием до камеры, поэтому объект обязан полностью помещаться в кадр.
- Код и готовые веса модели пока не опубликованы.
Перспективы применения
Axolotl3D открывает возможности для автоматического дополнения недостающих деталей в цифровых двойниках, создании более полных 3D‑реплик из ограниченного фотоматериала и упрощения процесса редактирования геометрии объектов в реальном времени.
«Уже известная геометрия выступает в качестве якоря, а нейросеть генерирует части объекта, информации о которых мало», — отметили исследователи Nvidia.
Пока проект находится в исследовательской стадии, но его архитектура демонстрирует потенциал для дальнейшего развития технологий image‑to‑3D.
Источник:
Nvidia представила Axolotl3D — модель для достраивания скрытых частей 3D‑объектов
Добавить комментарий
Если нужно ответить кому-то конкретно,
лучше нажать на «Ответить» под его комментарием