Зачем мне слои, а не ещё один постер
Плоская генерация умирает на первой правке. Клиент просит подвинуть заголовок, а заголовок впечатан в фон. Layer как раз про это: от 2 до 9 независимых RGBA-слоёв, которые можно собрать обратно.
В карточке модели рабочий пример гоняют в 1024, 12 шагов, и для проверенной конфигурации указана одна видеокарта на 80 гигабайт. Это не кнопка в моём Photoshop. Это вещь, которую я посмотрю чужими руками или не посмотрю вообще, если ради неё надо собирать сервер.
Текст на картинке
Обычные генераторы портят мелкие буквы. Ming как раз целится в макеты, где слова должны читаться, и принимает длинный промпт, до тысяч токенов. На бумаге это ближе к моей инфографике, чем к портрету.
Цифр «на сколько процентов буквы стали лучше» в тексте релиза нет, графики есть картинками. Пока я не открыл png и не увеличил подпись, я не верю обещанию. Про то, как текст на скане и в pdf уже ломается, у меня есть отдельный разбор: изменение текста через ИИ.
MIT не равен «можно в заказ»
Лицензия разрешает пользоваться весами свободнее, чем закрытый чат. Она не проверяет, похож ли постер на чужой бренд и читается ли состав на упаковке. Это по-прежнему моя проверка перед сдачей.
Если слои когда-нибудь приедут в нормальный файл, а не в папку png, я попробую на внутренней карточке, не на клиентской серии. Сначала один макет, потом разговор о сроке.
Короткие ответы
Можно ли ставить Ming клиенту уже сейчас?
Я бы не ставил в срок. Нужна тяжёлая видеокарта, а текст и слои надо проверить на файле, не на демо.
Чем это лучше обычной генерации постера?
Если слои правда независимые, правку заголовка не надо перерисовывать целиком. Это ещё надо увидеть в своём файле.
Инструменты
Рядом про текст, который нейросеть портит, и про инфографику до сметы.