kekoser, 17 сентября 2026 - 21:43 Qwen-Image-VAE-2.0: высоко‑компрессные VAE сохраняют детали и читаемость текста |
В техническом отчете представлена семейство VAE, способных уменьшить обычный компромисс между степенью пространственной компрессии, качеством восстановления и удобством обучения диффузионных моделей (diffusability). Авторы утверждают, что их решения позволяют использовать более сильную компрессию без потери мелких деталей, в частности текста, которые традиционно страдают при повышении коэффициента сжатия.
Стандартные латентные диффузионные модели работают с VAE, уменьшающими изображение в 8 раз (f8). При обучении диффузионных трансформеров (DiT) вычислительная сложность растёт пропорционально O(H^2W^2/f^4), поэтому увеличение коэффициента сжатия до f16 или f32 потенциально снижает затраты при генерации изображений с разрешением 2K и выше. Однако более сильное сжатие обычно размывает мелкие элементы, особенно текст, а увеличение числа каналов латентного пространства часто приводит к неконсистентным представлениям, которые трудно обучать.
В наборе представлены четыре модели, отличающихся степенью компрессии и числом каналов:
Все варианты используют лёгкий энкодер и более тяжелый декодер, лишены механизмов внимания и оснащены глобальными пропускными соединениями (Global Skip Connections, GSC). GSC переводят пространственные пиксели в каналы (space‑to‑channel) и пропускают первый этап даунсемплинга, благодаря чему высокочастотные детали, такие как контуры символов, попадают в латентное представление.
Анализ без пропусков и с локальными пропусками показал более медленную сходимость и худшее значение PSNR, что подтверждает эффективность предложенного подхода.
Для обучения использовались миллиарды изображений, предварительно отфильтрованные от размытия и артефактов сжатия. Особый акцент был сделан на документных изображениях: отсканированные статьи, слайды, постеры и веб‑страницы, а также синтетически сгенерированные тексты на реальных фонах. Символы имели размер от 5 до 20 px, что заставляло модели сохранять мелкие штрихи даже при 32‑кратном сжатии.
В отличие от многих VAE, авторы отказались от KL‑дивергенции и GAN‑компонентов. Финальная функция потерь выглядит так:
L = L1 + λ_lpips·L_LPIPS + λ_align·L_align
Для выравнивания латентов используется средний слой модели DINOv2‑L (не последний, без мульти‑слойного слияния). Вычисляются две метрики: косинусное сходство направлений и сходство матриц расстояний, отражающее пространственное расположение объектов. На ранних этапах обучения использовались строгие ограничения, которые затем ослаблялись, позволяя улучшить качество восстановления.
Традиционные наборы (ImageNet, FFHQ, TokBench) не оценивают качество восстановления текста. Чтобы исправить это, разработан набор из ~3 000 реальных фрагментов документов (книги, слайды, экзаменационные листы, журналы, газеты) на английском и китайском языках. Оценка проводится метрикой NED (Normalized Edit Distance): запускается OCR‑модель PP‑OCRv5 на оригинальном и восстановленном изображении, а полученные строки сравниваются. Для расчёта используется оригинальный OCR‑вывод как эталон, что нейтрализует собственные ошибки OCR.
Таблица ключевых показателей (показатели PSNR и NED):
| Модель | ImageNet PSNR | FFHQ PSNR | Документы NED |
|---|---|---|---|
| f16c128 | 35.90 | 43.10 | 0.9617 |
| f32c192 | — | — | 0.8555 |
Модель f16c128 достигает лучшего PSNR в своём классе и выставляет рекорд NED (0.9617), опережая даже f8‑модели, среди которых FLUX.1‑dev имеет NED = 0.9546. Модель f32c192 сохраняет приемлемый уровень читаемости текста (NED = 0.8555), превосходя несколько f16‑вариантов; большинство других f32‑моделей показывали NED в диапазоне 0.07–0.57.
При обучении диффузионного трансформера SiT на ImageNet (размер 256) без классификатор‑градиентного усиления (CFG) латентные представления от VAE f16c128 сходятся быстрее и генерируют более качественные изображения по сравнению с другими высококомпрессными VAE, несмотря на большое число каналов. Промежуточный вариант этой архитектуры использовался в модели Qwen-Image-2.0.
Увеличивая коэффициент сжатия (f16, f32) и одновременно повышая число каналов, а также добавляя глобальные пропускные соединения, можно сохранить детали, в том числе мелкий текст. Выравнивание латентов к среднему слою DINOv2 делает их более подходящими для диффузионных моделей, а отказ от KL‑дивергенции и GAN упрощает обучение без заметного ухудшения качества. Полученные VAE позволяют экономить ресурсы DiT‑моделей и при этом обеспечивают читаемость документов, что подтверждается новым бенчмарком OmniDoc‑TokenBench.
Источник: Qwen-Image-VAE-2.0 — Paper Summary
1 Обсудить → |

| 1 |
|