Zadnjih nekaj mesecev sem precej intenzivno testiral generiranje slik z umetno inteligenco za spletno trgovino in za blog, zato delim nekaj ugotovitev, ki so mi res prihranile čas. Namen ni reklama, ampak konkreten delovni tok, ki deluje tudi na povprečnem prenosniku brez močne grafične kartice, saj vse teče v oblaku.
1) Poziv (prompt) naj bo konkreten. Namesto "lep izdelek" napišem vrsto izdelka, material, ozadje, svetlobo in razmerje stranic, na primer: "keramična skodelica na hrastovi mizi, mehka stranska svetloba, nevtralno sivo ozadje, 4:5". Kratki pozivi dajo generične rezultate, predolgi pa model zmedejo - pri meni najbolje delujejo pozivi med 25 in 50 besedami.
2) Negativni poziv je pomembnejši, kot se zdi. e dodam "brez besedila, brez vodnega žiga, brez popačenih prstov", je delež uporabnih slik bistveno večji.
3) Ločljivost in kasnejše povečevanje. Najprej naredim več manjših različic (npr. 768 px), izberem najboljšo kompozicijo in šele nato povečam. Tako ne zapravljam časa za povečevanje slabih poskusov.
4) Doslednost stila. Če potrebujem serijo slik z enakim videzom, si shranim "osnovni" poziv in spreminjam samo predmet. Za spletno trgovino je enotnost pomembnejša od tega, da je vsaka slika sama zase najlepa.
Za oblačno generiranje in urejanje sem največ uporabljal ai image generator (SoraLum), ki poleg generiranja slik omogoča tudi urejanje po pozivu in generiranje videa, tako da se mi ni bilo treba selit med tremi orodji.
Zanima me še vaša praksa: kako rešujete besedilo na sliki (logotipi, napisi), ki ga modeli še vedno pogosto popačijo? Jaz napise dodajam kasneje v GIMP-u ali Inkscapu, ker je rezultat bolj predvidljiv. In kako pri vas zdrži kakovost, ko slike zmanjšate za splet - uporabljate WebP ali raje kakovostni JPEG okoli 80 %? Hvala za vsak konkreten nasvet.
1) Poziv (prompt) naj bo konkreten. Namesto "lep izdelek" napišem vrsto izdelka, material, ozadje, svetlobo in razmerje stranic, na primer: "keramična skodelica na hrastovi mizi, mehka stranska svetloba, nevtralno sivo ozadje, 4:5". Kratki pozivi dajo generične rezultate, predolgi pa model zmedejo - pri meni najbolje delujejo pozivi med 25 in 50 besedami.
2) Negativni poziv je pomembnejši, kot se zdi. e dodam "brez besedila, brez vodnega žiga, brez popačenih prstov", je delež uporabnih slik bistveno večji.
3) Ločljivost in kasnejše povečevanje. Najprej naredim več manjših različic (npr. 768 px), izberem najboljšo kompozicijo in šele nato povečam. Tako ne zapravljam časa za povečevanje slabih poskusov.
4) Doslednost stila. Če potrebujem serijo slik z enakim videzom, si shranim "osnovni" poziv in spreminjam samo predmet. Za spletno trgovino je enotnost pomembnejša od tega, da je vsaka slika sama zase najlepa.
Za oblačno generiranje in urejanje sem največ uporabljal ai image generator (SoraLum), ki poleg generiranja slik omogoča tudi urejanje po pozivu in generiranje videa, tako da se mi ni bilo treba selit med tremi orodji.
Zanima me še vaša praksa: kako rešujete besedilo na sliki (logotipi, napisi), ki ga modeli še vedno pogosto popačijo? Jaz napise dodajam kasneje v GIMP-u ali Inkscapu, ker je rezultat bolj predvidljiv. In kako pri vas zdrži kakovost, ko slike zmanjšate za splet - uporabljate WebP ali raje kakovostni JPEG okoli 80 %? Hvala za vsak konkreten nasvet.