Это разные вещи. Пока что эротические ИИ - полулегальные, где-то в серой зоне. Они маломощные, недостаточно обученные, и если обученные - то не на том на чём надо. А программистские работают на полную мощность. Поэтому когда эротическим ИИ всё же поднимут мощность и дообучат как надо - тогда будет совсем по-другому.
Тут есть один тонкий момент. Программисткие модели легче обучать - есть простой критерий, рабочий результат или нет. А вот для эротического рассказа, попробуйте создать автоматическую функцию, которая отличит хороший рассказ, от плохого. Поэтому, что в написании эротических текстов, что литературных текстов вообще, модели сильно плавают. И будет ли улучшение, вопрос.
Предполагаю, что они ещё не остались без работы исключительно по причине, описанной мной в первой части комментария. Ещё пару лет назад, если постараться - можно было генерировать порно-картинки настолько качественные, что не отличишь от фотографий. Плюс к тому там получалось именно то, что хочет видеть конкретный пользователь. Причём в разных стилях - хоть фотореализм, хоть аниме, хоть ещё что. Сейчас естественно ситуация намного улучшилась. И, если постараться - можно ещё и получить картинки вообще без цензуры. Любые. Хоть CP. Что никаким онлифанщицам недоступно в принципе.
Модели генерации картинок сильно выросли, спору нет. Но проблемы остались. Да можно быстро сгенерировать много фотографий в разных стилях. А вот сгенерировать много фотографий одного человека в одной обставновке, тут начинаются проблемы. Процесс то стохастический, все фото получаются разными. Эту проблему пытаются решить, но пока хорошего решения не видно. С видео проблем еще больше. Да, развивается, но что оно скоро заменит реальное, сомнительно.
Цитата
А вот сгенерировать много фотографий одного человека в одной обставновке, тут начинаются проблемы. Процесс то стохастический
Не совсем так. Не знаю, как уж там оно в коде реализовано. Но в проекте, про который я упоминал ранее, была настройка. Можно было выбрать либо фиксированный сид (seed), либо случайный. При случайном - картинка получалась каждый раз разная, даже если задать одинаковые тэги. А при фиксированном - при одинаковых тэгах картинка была одинаковая. То есть какая-то повторяемость там есть. Притом существовал апскейл - если сгенерировалось то что надо, можно было попросить бота сделать ту же самую картинку, но в более высоком разрешении.
А вот сгенерировать много фотографий одного человека в одной обставновке, тут начинаются проблемы. Процесс то стохастический
Не совсем так. Не знаю, как уж там оно в коде реализовано. Но в проекте, про который я упоминал ранее, была настройка. Можно было выбрать либо фиксированный сид (seed), либо случайный. При случайном - картинка получалась каждый раз разная, даже если задать одинаковые тэги. А при фиксированном - при одинаковых тэгах картинка была одинаковая. То есть какая-то повторяемость там есть. Притом существовал апскейл - если сгенерировалось то что надо, можно было попросить бота сделать ту же самую картинку, но в более высоком разрешении.
Seed - это затравка для генератора псевдослучайных чисел: один и тот же seed дает ту же последовательность и, при прочих равных, ту же картинку. Но я говорю немного о другом - о генерации серии изображений с одним или несколькими персонажами в одних и тех же декорациях. Например, серии для комикса или иллюстраций к рассказу.
Какие-то наработки в этом направлении уже есть, но работают они пока нестабильно, особенно если в сцене участвует несколько персонажей. Создать отдельную уникальную картинку на заданную тему - пожалуйста. А вот сделать серию, где сохраняются те же персонажи, их внешность, одежда и декорации, уже заметно сложнее.
У видео свои проблемы. Сейчас на YouTube полно китайских дорам, сгенерированных ИИ. Посмотрите - разница с обычной съемкой видна очень сильно. В большинстве случаев получается практически мусор. Для совсем невзыскательного зрителя, возможно, и сойдет, но говорить о том, что это уже способно заменить реальных актеров, явно рано. Посмотрим, что будет дальше.
Всё просто - потому что я, как пользователь, видел немало сервисов, которые генерируют и то и другое, и ещё текст. Что у них там "под капотом" - мне, как пользователю, не очень важно. Более важно, что на практике я по одному адресу могу получить всё. А уж куда там он маршрутизирует обращения за разными носителями - дело десятое.
Просто ваше исходное сообщение выглядело так "модели уже настолько умны, что и текст генерят и картинки и видео" и звучало это так, что это делает одна умная модель. Я просто разъяснил, что это три разные модели, у них есть пересечения конечно, но они совершенно разные. И принцип работы разный. Для болталок aka LLM используется авторегрессионный принцип - текст генерируется токен за токеном последовательно. В картинках и видео используются diffusion модели которые работают по принципу
шум -> грубая структура -> детали -> готовое изображение
(а шум как раз определяется seed). То есть генерируется сразу целая картинка или серия для видео, а не пиксел за пикселом.
Есть наработки генерации текста по принципу диффузии, но пока там особых прорывов не видно, хотя теоретически для написания литературных текстов они могут работать лучше - они видет кусок тескта целиком и могут постепенно определять детали, не теряя связности и общей идеи. В обычных моделях если вначале модель сгенерировала последовательность токенов (слов) которые плохо согласуются с продолжением, она уже ничего сделать не может, только должна подстраивать продолжение.
Я тоже написал программу для писания текстов, результаты есть на этом сайте. Я пробовал разные модели и DeepSeek не лучшая из них (по моему мнению). Мне пока понравилась GLM5.2 которая в определенном режиме позволяет генерировать довольно откровенные тексты (в разумных пределах)
Что ваш программист не смог найти локальную модель без цензуры, довольно странно их полно, причем разных и разного размера. Причем там цензуры практически нет, будут генерить все, что угодно (тут надо быть осторожным и не попасть под УК). Но тут либо надо урезать размеры, либо рентовать железо с большим количеством VRAM, а это тоже стоит денег.
Всё просто - потому что я, как пользователь, видел немало сервисов, которые генерируют и то и другое, и ещё текст. Что у них там "под капотом" - мне, как пользователю, не очень важно. Более важно, что на практике я по одному адресу могу получить всё. А уж куда там он маршрутизирует обращения за разными носителями - дело десятое.
Просто ваше исходное сообщение выглядело так "модели уже настолько умны, что и текст генерят и картинки и видео" и звучало это так, что это делает одна умная модель. Я просто разъяснил, что это три разные модели, у них есть пересечения конечно, но они совершенно разные. И принцип работы разный. Для болталок aka LLM используется авторегрессионный принцип - текст генерируется токен за токеном последовательно. В картинках и видео используются diffusion модели которые работают по принципу
шум -> грубая структура -> детали -> готовое изображение
(а шум как раз определяется seed). То есть генерируется сразу целая картинка или серия для видео, а не пиксел за пикселом.
Есть наработки генерации текста по принципу диффузии, но пока там особых прорывов не видно, хотя теоретически для написания литературных текстов они могут работать лучше - они видет кусок тескта целиком и могут постепенно определять детали, не теряя связности и общей идеи. В обычных моделях если вначале модель сгенерировала последовательность токенов (слов) которые плохо согласуются с продолжением, она уже ничего сделать не может, только должна подстраивать продолжение.
Я тоже написал программу для писания текстов, результаты есть на этом сайте. Я пробовал разные модели и DeepSeek не лучшая из них (по моему мнению). Мне пока понравилась GLM5.2 которая в определенном режиме позволяет генерировать довольно откровенные тексты (в разумных пределах)
Что ваш программист не смог найти локальную модель без цензуры, довольно странно их полно, причем разных и разного размера. Причем там цензуры практически нет, будут генерить все, что угодно (тут надо быть осторожным и не попасть под УК). Но тут либо надо урезать размеры, либо рентовать железо с большим количеством VRAM, а это тоже стоит денег.
Спасибо за объяснения. Вы явно понимаете в этой теме намного больше моего :)
А что касается того программиста - не сказал бы, что он "мой". Я его лично не знаю и соприкасался с ним только как пользователь его проекта. Предполагаю, что он не то чтобы не смог найти модель без цензуры - а посчитал это не особо важным. Для его проекта первоочередными были картинки, так что он занялся ими. А текстовую составляющую отложил на потом или вовсе на неё наплевал. Тэги генерит - ну и ладно, сойдёт так.