kekoser, 17 сентября 2026 - 21:43

Qwen-Image-VAE-2.0: высоко‑компрессные VAE сохраняют детали и читаемость текста

Что предлагает Qwen-Image-VAE-2.0

В техническом отчете представлена семейство VAE, способных уменьшить обычный компромисс между степенью пространственной компрессии, качеством восстановления и удобством обучения диффузионных моделей (diffusability). Авторы утверждают, что их решения позволяют использовать более сильную компрессию без потери мелких деталей, в частности текста, которые традиционно страдают при повышении коэффициента сжатия.

Почему это важно

Стандартные латентные диффузионные модели работают с VAE, уменьшающими изображение в 8 раз (f8). При обучении диффузионных трансформеров (DiT) вычислительная сложность растёт пропорционально O(H^2W^2/f^4), поэтому увеличение коэффициента сжатия до f16 или f32 потенциально снижает затраты при генерации изображений с разрешением 2K и выше. Однако более сильное сжатие обычно размывает мелкие элементы, особенно текст, а увеличение числа каналов латентного пространства часто приводит к неконсистентным представлениям, которые трудно обучать.

Архитектурные решения

В наборе представлены четыре модели, отличающихся степенью компрессии и числом каналов:

  • f16c64: 16‑кратное снижение, 64 канала, 76 М параметров в энкодере и 248 М в декодере.
  • f16c128: 16‑кратное, 128 каналов, те же количества параметров, что и у предыдущей.
  • f32c128: 32‑кратное, 128 каналов, 77 М/250 М параметров.
  • f32c192: 32‑кратное, 192 канала, 78 М/250 М параметров.

Все варианты используют лёгкий энкодер и более тяжелый декодер, лишены механизмов внимания и оснащены глобальными пропускными соединениями (Global Skip Connections, GSC). GSC переводят пространственные пиксели в каналы (space‑to‑channel) и пропускают первый этап даунсемплинга, благодаря чему высокочастотные детали, такие как контуры символов, попадают в латентное представление.

Анализ без пропусков и с локальными пропусками показал более медленную сходимость и худшее значение PSNR, что подтверждает эффективность предложенного подхода.

Обучающие данные

Для обучения использовались миллиарды изображений, предварительно отфильтрованные от размытия и артефактов сжатия. Особый акцент был сделан на документных изображениях: отсканированные статьи, слайды, постеры и веб‑страницы, а также синтетически сгенерированные тексты на реальных фонах. Символы имели размер от 5 до 20 px, что заставляло модели сохранять мелкие штрихи даже при 32‑кратном сжатии.

Функция потерь

В отличие от многих VAE, авторы отказались от KL‑дивергенции и GAN‑компонентов. Финальная функция потерь выглядит так:

L = L1 + λ_lpips·L_LPIPS + λ_align·L_align

Для выравнивания латентов используется средний слой модели DINOv2‑L (не последний, без мульти‑слойного слияния). Вычисляются две метрики: косинусное сходство направлений и сходство матриц расстояний, отражающее пространственное расположение объектов. На ранних этапах обучения использовались строгие ограничения, которые затем ослаблялись, позволяя улучшить качество восстановления.

Новый бенчмарк OmniDoc‑TokenBench

Традиционные наборы (ImageNet, FFHQ, TokBench) не оценивают качество восстановления текста. Чтобы исправить это, разработан набор из ~3 000 реальных фрагментов документов (книги, слайды, экзаменационные листы, журналы, газеты) на английском и китайском языках. Оценка проводится метрикой NED (Normalized Edit Distance): запускается OCR‑модель PP‑OCRv5 на оригинальном и восстановленном изображении, а полученные строки сравниваются. Для расчёта используется оригинальный OCR‑вывод как эталон, что нейтрализует собственные ошибки OCR.

Результаты

Таблица ключевых показателей (показатели PSNR и NED):

МодельImageNet PSNRFFHQ PSNRДокументы NED
f16c12835.9043.100.9617
f32c1920.8555

Модель f16c128 достигает лучшего PSNR в своём классе и выставляет рекорд NED (0.9617), опережая даже f8‑модели, среди которых FLUX.1‑dev имеет NED = 0.9546. Модель f32c192 сохраняет приемлемый уровень читаемости текста (NED = 0.8555), превосходя несколько f16‑вариантов; большинство других f32‑моделей показывали NED в диапазоне 0.07–0.57.

Диффузионная обучаемость (Diffusability)

При обучении диффузионного трансформера SiT на ImageNet (размер 256) без классификатор‑градиентного усиления (CFG) латентные представления от VAE f16c128 сходятся быстрее и генерируют более качественные изображения по сравнению с другими высококомпрессными VAE, несмотря на большое число каналов. Промежуточный вариант этой архитектуры использовался в модели Qwen-Image-2.0.

Выводы

Увеличивая коэффициент сжатия (f16, f32) и одновременно повышая число каналов, а также добавляя глобальные пропускные соединения, можно сохранить детали, в том числе мелкий текст. Выравнивание латентов к среднему слою DINOv2 делает их более подходящими для диффузионных моделей, а отказ от KL‑дивергенции и GAN упрощает обучение без заметного ухудшения качества. Полученные VAE позволяют экономить ресурсы DiT‑моделей и при этом обеспечивают читаемость документов, что подтверждается новым бенчмарком OmniDoc‑TokenBench.

Источник: Qwen-Image-VAE-2.0 — Paper Summary

+1
1 понравилось
0 не понравилось
+
1
Обсудить →
1
+
@lonelyowl@pl.kotobank.ch, 17 сентября 2026 - 21:57 #

Славься, бобес

Добавить комментарий
Если нужно ответить кому-то конкретно,
лучше нажать на «Ответить» под его комментарием


Реклама
240x400