Tylko teraz 35% rabatu na hasło #DEV. Gwarancja Pracy lub Stażu gratis i wygodne finansowanie — nawet 40 rat 0%. Kto pierwszy, ten lepszy!
← Blog

Cyfrowa sztuka. Przegląd ciekawych rozwiązań do generowania muzyki, obrazów i filmów za pomocą AI.

08.08.2024

Cyfrowa sztuka. Przegląd ciekawych rozwiązań do generowania muzyki, obrazów i filmów za pomocą AI.

Poznaj praktyczne przykłady darmowych rozwiązań w zakresie Gen AI i dowiedz się, w w jaki sposób sztuczna inteligencja jest w stanie samodzielnie generować treści.

Znajdujemy się w momencie zmian technologicznych, które dotykają branż na całym świecie. Wiele projektów i zadań już dzisiaj powstaje przy użyciu sztucznej inteligencji (AI), która ułatwia, przyspiesza i wspomaga pracę. Stykamy się z rozwiązaniami AI na co dzień, choć nie zawsze mamy tego świadomość. Dzisiaj opowiem o technologiach umożliwiających generowanie muzyki, grafik i filmów za pomocą osiągnięć sztucznej inteligencji.

 

Czym jest Gen AI?

Na początku wytłumaczę, czym jest Gen AI (generative AI) lub generatywna sztuczna inteligencja. To taki rodzaj sztucznej inteligencji, który umożliwia indywidualnym użytkownikom tworzenie całkiem nowej treści, również na dużą skalę. Nie potrzeba zdolności graficznych, umiejętności montażowych, pisarskich, czy bycia doświadczonym DJ-em. Wystarczy odpowiednie hasło wpisane w narzędzia, by stworzyć całkowicie nową treść. Co ważne, w porównaniu do sztucznej inteligencji, która została zaprojektowana tak, aby rozpoznawać i klasyfikować dane, Gen AI tworzy nową jakość w reakcji na podpowiedź.

 

Gen AI działa na podstawie tzw. modeli generatywnych — złożonych algorytmów, które za pomocą różnych metod obliczeniowych potrafią tworzyć nowe dane. Oczywiście modele te na początku uczą się klasyfikacji i łączenia danych na podstawie zbiorów treningowych, np. przetwarzają dużą liczbę obrazów, filmów lub dźwięków uporządkowanych według gatunków muzyki.

 

Jest to niezbędne do ich prawidłowego działania. Dla przykładu — jeżeli model generowania filmów nie otrzyma danych treningowych, dotyczących tego w jaki sposób wygląda “Biała łódź kołysząca się na pełnym morzu w trakcie sztormu”, w odpowiedzi dostaniemy zlepek nic nie znaczących danych graficznych. Oczywiście model będzie starał się wyciągać dane z kontekstu i dostarczy efekt najbardziej zbliżony do naszych oczekiwań, ale niewiele będzie to miało wspólnego z tym, czego tak naprawdę oczekujemy. To spowoduje, że tak czy inaczej, pracę będziemy musieli wykonać sami.

 

Generowanie treści — przykładowe narzędzia

Generowanie jakościowych treści na podstawie wpisywanych fraz wbrew pozorom nie należy do najprostszych zadań. Trzeba być naprawdę dokładnym, by osiągnąć zamierzony efekt. Jednak ze względu na powszechne wykorzystanie contentu do działań promocyjnych, zwłaszcza w branżach kreatywnych, istnieje dzisiaj mnóstwo narzędzi, które można do tego wykorzystywać. Istnieją oczywiście mnóstwo płatnych narzędzi z bogatą lista funkcjonalności, ja jednak posłużę się bezpłatnymi przykładami, aby każdy z was mógł z tych rozwiązań skorzystać.

 

Generatory tekstu 

Jestem przekonany, że większość kojarzy usługi takie, jak Chat GPT(ang. Generative Pre-trained — pre-training oznacza trening na dużych zbiorach danych tekstowych) czy Google Gemini. Są na tyle spopularyzowane, że chyba nikomu nie trzeba ich przedstawiać. Inną, mniej rozpoznawalną usługą generowania tekstu jest Microsoft Copilot (inaczej Bing AI). Za pomocą tych usług możecie w prosty sposób przygotować wypracowania, obliczenia, prezentacje, streszczenia, pomysły, a nawet całe artykuły, choć z jakością dużych tekstów bywa różnie. W marketingu generatory tekstowe wykorzystywane są do przygotowywania treści i pomysłów w kampaniach reklamowych, postów lub opisów produktów, czy skryptów do filmów. Z kolei w branży IT np. można te narzędzia wykorzystać do tworzenia przykładowych scenariuszy testowych lub prostego kodowania. Robicie dużo błędów? Warto rzucić okiem na Grammarly. Usługę, która pozwala na inteligentne poprawianie błędów w tekście lub całkowitą zmianę jego stylu np. na bardziej przekonujący.

Generatory obrazu

Tutaj robi się ciekawiej przede wszystkim dlatego, że jeszcze do niedawna Gen AI miała problem z generowaniem właściwych obrazów zawierających np. ludzkie dłonie czy twarze. Na szczęście problem został rozwiązany i dzisiaj możemy skorzystać z usług takich jak Adobe Firefly, Microsoft Designer, Canva, czy mniej popularny generator obrazów AI Craiyon. Narzędzia te pozwalają na wygenerowanie nowych obrazów poprzez tekstowe polecenie (prompt) i bardzo dobrze sobie z tym radzą. Niestety tutaj poprzeczka została podniesiona, ponieważ im bardziej szczegółowy obraz chcemy wygenerować, tym bardziej precyzyjny prompt musimy wprowadzić w oknie polecenia. W przypadku tych usług możemy liczyć na różnorodne style lub techniki artystyczne generowanej grafiki. Istnieją także narzędzia do poprawy jakości istniejącego zdjęcia lub usuwania szumów - VanceAI. Z kolei jeżeli liczycie na bardziej wyrafinowane grafiki to z pomocą narzędzia Fotor (to również darmowy generator obrazów AI) stworzycie grafiki niczym Van Gogh lub Picasso. Modele DALL-e, Midjourney generują nowe obrazy w oparciu o prompty. Stały się rewolucją w zakresie tworzenia gier, sztuki, czy nawet projektowania grafiki. 

 

Generatory dźwięku

Specjaliści zajmujący się automatycznym generowaniem dźwięku mają twardy orzech do zgryzienia, ponieważ wybierając konkretną usługę, otrzymają w pakiecie bibliotekę sampli i dźwięków, na której mogą pracować. Wszystko zależy od zastosowania — muzykę tworzy się dla wielu branż, takich jak filmy, gry wideo, reklamy lub choćby media społecznościowe. Pozostaje jeszcze kwestia integracji z innymi narzędziami. Wybierając generator należy być pewnym, do jakich zastosowań i celów go wykorzystamy, oraz jaki efekt chcemy osiągnąć.

 

Audiobox (Meta) to innowacyjna platforma, która pozwala na pracę z dźwiękiem na wiele sposobów. Umożliwia szybkie generowanie wysokiej jakości dźwięków, oraz tworzenie efektów dźwiękowych wykorzystywanych np. filmach. Umożliwia łączenie kilku ścieżek dźwiękowych np. śpiew ptaków i szum drzew, wraz z narracją i muzyką. Narzędzie pozwala także na edycję już istniejącego nagrania głosu np. zmianę tempa, stylu wypowiedzi lub stworzenie aranżacji np. efektu pogłosu w pustym pomieszczeniu.

 

SunoAI to z kolei  narzędzie do tworzenia utworów muzycznych. Za pomocą tekstu można wygenerować pełny utwór muzyczny z wokalem i podkładem. Możliwości są nieograniczone. Jeżeli chcielibyście stworzyć muzykę w oparciu o trwające igrzyska olimpijskie - żaden problem - w trakcie moich testów udało mi się stworzyć 2 takie utwory z dźwiękiem, wokalem i gotowym tekstem piosenki. 

 

Innym równie ciekawym przykładem jest generator muzyki AI Stable Audio w którym po wpisaniu odpowiedniego tekstu, określeniu czasu trwania utworu (do 3 minut), gatunku, nastroju, tempa i instrumentu, otrzymamy gotowe audio. Nie jest on co prawda tak samo zaawansowany jak Suno, lecz do podstawowych działań w zupełności wystarczy. Analiza wzorców w kompozycjach i muzyce umożliwia modelom tworzenie pełnych i całkiem nowych utworów muzycznych. Dla przykładu zobaczcie co można zrobić z tymi narzędziami na poniższym filmie

 

 

 

 

Generatory wideo 

Jednym z najpopularniejszych narzędzi wykorzystywanych do generowania wideo jest Syntesia. Ten zasilany przez AI video generator pozwala na tworzenie wideo z awatarami napędzanymi sztuczną inteligencją. Wystarczy wprowadzić odpowiednią instrukcję, a w kilka chwil zostanie wygenerowana postać-awatar, odczytująca żądany przez nas tekst. Inne, równie popularne generatory filmów ai to Deepbrain.io i Lumen5. Mogą być wykorzystywane w marketingu, kampaniach reklamowych, sprzedaży, korporacjach (odczytywanie prezentacji) tworząc realistyczne awatary, które np. prezentują kwartalniki związane z… branżą gastronomiczną.

 

Równie ciekawym narzędziem jest CapCut AI. W odróżnieniu od pozostałych narzędzi wymagania pobrania na dysk lub smartfon. Używany jest głównie przez twórców w media społecznościowych. Pozwala na edycję wideo z wykorzystaniem sztucznej inteligencji, tworzenie napisów na podstawie mowy, ulepszanie wideo itd. CapCut działa poprzez zastosowanie różnych technik sztucznej inteligencji, takich jak uczenie maszynowe, sieci neuronowe i algorytmy przetwarzania obrazów i dźwięków, aby automatycznie tworzyć i edytować wideo.

 

Czym jest prompt?

Powiedzieliśmy sobie wcześniej, że aby wygenerować daną treść, nie ważne czy to będzie tekst, czy krótkometrażowy film (tak, to już można zrobić — przykłady zobaczysz tutaj), musimy wpisać w narzędzie odpowiednią frazę. Jest to tzw. prompt, czyli polecenie, instrukcja, którą model przetwarza, dostarczając w odpowiedz informację zwrotną. Dla każdego modelu będzie to działało dość podobnie. 

 

Załóżmy, że chcesz, aby model wygenerował opis samolotu Boeing 737-800, zatem Twój prompt powinien być dokładny i klarowny. Dobrze skonstruowany prompt pomoże modelowi zrozumieć kontekst i wygenerować najbardziej trafną i precyzyjną odpowiedź

 

“Opisz budowę i funkcję samolotu Boeing 737-800”;

 

lub jeszcze dokładniejszy prompt:

 

„Opisz, jak wygląda Boeing 737-800, zwracając uwagę na jego charakterystyczne cechy zewnętrzne i wnętrze.”

 

Ważne, by w formułowaniu promptów być precyzyjnym, unikać potocznego i emocjonalnego słownictwa. Posługuj się prostymi i konkretnymi zdaniami, zaznaczając, co dokładnie chcesz uzyskać. Więcej porad na temat skutecznych promptów znajdziesz w tym filmie.

 

 

 

 

 

Rozwiązania z zakresu Gen AI są dzisiaj wykorzystywane głównie w branżach kreatywnych i marketingu. W sztuce generatory treści używane są w produkcjach takich firm, jak studia gier, filmów, czy wydawnictw muzycznych. Unikatowe funkcje i coraz bogatsza oferta sprawiają, że narzędzia te są chętnie wykorzystywane do tworzenia wysokiej jakości treści również przez zwykłych użytkowników (choćby w social mediach).

 

Rosnąca popularność Gen AI powoduje stale zwiększające się zapotrzebowanie na specjalistów w zakresie tworzenia, testowania i utrzymywania modeli. Rola specjalistów jest kluczowa, ponieważ bez ich udziału modele te nie będą poprawnie funkcjonowały. Nad ich rozwojem pracują inżynierowie AI, eksperci w zakresie uczenia maszynowego, a nad całością projektów czuwają Machine Learning Operations — eksperci odpowiedzialni za sprawny przepływ pracy w procesach związanych ze sztuczną inteligencją. A może Ty również myślisz o pracy związanej z AI i chcesz rozwijać się w tym zakresie? Sprawdź nasz kurs Machine Learning & AI, by zacząć karierę w naprawdę przyszłościowej branży.