Nem minden mesterséges intelligencia érti ugyanazt az utasítást
Az előző két részben azt néztük meg, hogyan érdemes feladatot adni egy AI-chatbotnak, és mit tehetünk, ha az első válasz nem olyan lett, mint amilyet szerettünk volna.
Van azonban még egy fontos különbség: nem mindegy, milyen típusú mesterséges intelligenciához beszélünk.
Egy szöveges chatbotnak azt mondjuk el, mit szeretnénk megtudni vagy elkészíteni. Egy képgenerátornak azt kell leírnunk, mit szeretnénk látni. Egy videógenerátornál pedig már azt is meg kell határoznunk, mi történjen a jelenetben.
Ugyanaz az alapötlet tehát egészen más utasítást kíván attól függően, hogy szöveget, képet vagy videót szeretnénk.
Chatbot: mondd el a feladatot és a körülményeket
Egy chatbot szövegekkel dolgozik. Kérhetünk tőle magyarázatot, ötleteket, összefoglalót, levelet, Facebook-bejegyzést vagy egy meglévő szöveg javítását.
Tegyük fel, hogy egy kertészet tavasszal muskátlivásárt rendez.
Egy nagyon egyszerű kérés így hangozhat:
Írj egy Facebook-bejegyzést a muskátlivásárunkról.
Ebből valószínűleg készül valamilyen használható szöveg, de az AI nem tudja, kiknek szóljon, mit érdemes kiemelnie, és milyen legyen a hangvétele.
Jobb eredményt kaphatunk ezzel:
Írj egy Facebook-bejegyzést egy helyi kertészet tavaszi muskátlivásáráról. Elsősorban környékbeli családoknak és hobbikertészeknek szóljon. Legyen barátságos és közvetlen, legfeljebb 120 szó. Említsd meg, hogy több szín közül lehet választani, és szombaton ültetési tanácsot is adunk. A végén hívd meg az olvasókat a kertészetbe, de ne legyen túl reklámszerű.
Ebben már benne van a feladat, a célközönség, a stílus, a hosszúság, a fontos információ és a kívánt befejezés.
A chatbotnál azt is elmondhatjuk, hogyan dolgozzon. Például:
Először sorold fel a bejegyzés három lehetséges fő üzenetét. A szöveget csak azután írd meg, hogy választottam közülük.
Vagy:
Mielőtt válaszolsz, kérdezd meg tőlem, milyen növények szerepelnek az akcióban, mikor lesz a rendezvény, és van-e valamilyen kedvezmény.
Nem kell tehát minden részletet előre kitalálnunk. A chatbotot arra is megkérhetjük, hogy segítsen pontosítani a feladatot.
Képgenerátor: azt írd le, amit látni szeretnél
A képgenerátor másképpen működik. Nem elég annyit mondani neki, hogy mi a kép témája. Azt kell leírnunk, milyen legyen maga a látvány.
Egy túl általános kérés például így hangzik:
Készíts egy képet a muskátlivásárról.
Erre kaphatunk egy szép képet, de könnyen lehet, hogy nem hasonlít egy magyarországi kertészetre. Talán túl elegáns lesz, esetleg hatalmas vásártér jelenik meg rajta, vagy olyan felirat kerül a képre, amely értelmetlen betűkből áll.
Érdemes részletesebben leírni a jelenetet:
Készíts élethű, barátságos hangulatú képet egy kisvárosi magyar kertészet tavaszi muskátlivásáráról. Az előtérben piros, rózsaszín és fehér muskátlikkal teli asztalok legyenek. A háttérben néhány vásárló válogasson a növények között. Napos délelőtt, természetes fények, vidám, de nem túlzsúfolt környezet. Fekvő, 16:9 képarányú kép készüljön Facebook-bejegyzéshez. A képen ne legyen felirat vagy logó.
A képgenerátornál tehát érdemes meghatározni:
- mi legyen a képen;
- hol játszódjon a jelenet;
- kik vagy mik szerepeljenek rajta;
- milyen legyen a hangulat és a megvilágítás;
- milyen stílusban készüljön;
- milyen legyen a képarány;
- mi ne szerepeljen rajta.
A „barátságos” vagy „szép” önmagában kevés. Sokkal többet segít, ha leírjuk, mitől legyen barátságos a kép: természetes fény, hétköznapi környezet, mosolygó emberek, meleg színek vagy éppen rendezett, nyugodt kompozíció.
Azt is érdemes megmondani, mire használjuk a képet. Egy Facebook-bejegyzéshez általában fekvő vagy négyzetes kép készül, míg egy telefonon megjelenő rövid videó borítójához inkább álló formátumra lehet szükség.
A képre írt szöveggel óvatosan bánjunk. A képgenerátorok gyakran hibásan jelenítik meg a hosszabb feliratokat. Általában jobb felirat nélkül elkészíteni a képet, majd a szöveget egy képszerkesztőben elhelyezni rajta.
Videógenerátor: nemcsak a látványt, a mozgást is írd le
A videógenerátornál eggyel tovább kell lépnünk. Itt nemcsak azt kell megmondani, mit lássunk, hanem azt is, hogy mi történjen.
Egy túl rövid utasítás például:
Készíts videót egy kertészetről.
Ebből szinte bármi lehet. Nem tudjuk, hogy a kamera mit mutat, mozog-e, kik szerepelnek a jelenetben, és mi történik az öt vagy tíz másodperc alatt.
Egy pontosabb videós utasítás így szólhat:
Öt másodperces, élethű videó egy kisvárosi kertészetben. A kamera lassan közelít egy színes muskátlikkal teli asztalhoz. Egy középkorú nő felemel egy rózsaszín virágot, megnézi, majd mosolyogva visszateszi. Napos délelőtt, természetes mozgás, barátságos tavaszi hangulat. A videó legyen álló, 9:16 képarányú. Ne legyen rajta felirat, logó vagy hirtelen kameramozgás.
Ebben már szerepel:
- a videó hossza;
- a helyszín;
- a főszereplő;
- a cselekvés;
- a kamera mozgása;
- a hangulat;
- a képarány;
- és az is, mit szeretnénk elkerülni.
Rövid videóknál különösen fontos, hogy ne akarjunk túl sok eseményt egyetlen jelenetbe zsúfolni.
Ha azt kérjük, hogy valaki lépjen be a kertészetbe, válogasson a virágok között, beszéljen az eladóval, fizessen, majd boldogan távozzon, mindezt öt másodperc alatt, könnyen zavaros vagy természetellenes eredményt kapunk.
Jobb, ha ezt több rövid jelenetre bontjuk:
- A vásárló belép a kertészetbe.
- Közelkép készül a színes muskátlikról.
- A vásárló kiválaszt egy virágot.
- Az eladó átadja a becsomagolt növényt.
Egy jelenetben lehetőleg egy jól érthető fő cselekvés történjen.
Ugyanaz az ötlet, három különböző prompt
Nézzük meg röviden ugyanazt a feladatot háromféle AI esetében.
Ha szöveget szeretnénk:
Írj rövid, barátságos Facebook-bejegyzést egy helyi kertészet muskátlivásáráról. A célközönség környékbeli hobbikertészekből álljon. A végén természetes hangon hívd meg őket a szombati rendezvényre.
Ha képet szeretnénk:
Élethű kép egy kisvárosi magyar kertészet muskátlivásáráról, színes virágokkal, válogató vásárlókkal és természetes tavaszi fényekkel. Barátságos, hétköznapi hangulat, fekvő képarány, felirat és logó nélkül.
Ha videót szeretnénk:
Öt másodperces, élethű videó egy kertészetben. A kamera lassan végighalad a színes muskátlikkal teli asztal mellett, miközben egy vásárló felemel és megnéz egy virágot. Természetes mozgás, napos tavaszi délelőtt, álló képarány, felirat nélkül.
Az alapötlet ugyanaz, de az utasítás fókusza eltér.
A chatbotnál a mondanivalót és a célközönséget határozzuk meg. A képgenerátornál a látványt és a kompozíciót. A videógenerátornál pedig a látvány mellett a cselekvést, az időt és a kamera mozgását is.
Ha elsőre nem sikerül, itt is lehet javítani
A képet vagy videót készítő AI-nál sem kell elfogadnunk az első eredményt.
Képnél mondhatjuk például:
A kertészet túl nagy és túl modern lett. Legyen kisebb, családiasabb, és hasonlítson egy magyar kisvárosi kertészetre.
Videónál pedig:
A kameramozgás túl gyors. A kamera maradjon közel az asztalhoz, és lassan haladjon balról jobbra. A szereplő csak egyetlen virágot emeljen fel.
Itt is ugyanaz a folyamat működik:
Kérés → eredmény → visszajelzés → javítás.
A különbség csupán az, hogy szövegnél a tartalmat és a hangvételt javítjuk, képnél a látványt és az elrendezést, videónál pedig ezek mellett a mozgást és a történést is.
Nem varázsszavakra, hanem pontos elképzelésre van szükség
A jó prompt nem attól jó, hogy hosszú, bonyolult vagy tele van angol szakkifejezésekkel.
Attól jó, hogy az adott eszköz számára fontos információkat tartalmazza.
A chatbotnak mondjuk el, milyen feladatot végezzen el, kinek és milyen céllal. A képgenerátornak írjuk le, mit szeretnénk látni. A videógenerátornál pedig határozzuk meg azt is, mi történjen, hogyan mozogjon a szereplő és mit mutasson a kamera.
Nem kell mindent elsőre tökéletesen megfogalmaznunk. Elkészítjük az első változatot, megnézzük az eredményt, majd pontosítunk.
A mesterséges intelligencia használatának talán ez a legegyszerűbb szabálya:
Ne azt várjuk, hogy kitalálja a fejünkben lévő képet. Segítsünk neki minél pontosabban megmutatni.





