Kiedy klikasz „play", Ty słyszysz melodię. Maszyna nie słyszy nic — dostaje strumień liczb opisujących ciśnienie powietrza tysiące razy na sekundę. Cała rewolucja rekomendacji, wykrywania nastroju i generowania muzyki polega na jednym: jak sprytnie te liczby zamienić w znaczenie.
Od fali do liczb Nagranie to sygnał próbkowany zwykle 44 100 razy na sekundę (44,1 kHz). To surowa fala — wierna, ale „głupia": nie mówi nic o tym, czy słychać gitarę, czy krzyk. Dlatego pierwszym krokiem prawie zawsze jest transformata Fouriera: rozkładamy krótki fragment dźwięku na składowe częstotliwości. Odpowiada na pytanie „jakie wysokości brzmią teraz i jak głośno".
Spektrogram — zdjęcie rentgenowskie dźwięku Sklejając kolejne takie „zdjęcia" częstotliwości w czasie, dostajemy spektrogram: obraz, na którym oś pozioma to czas, pionowa to wysokość, a jasność to energia. To przełom, bo dźwięk staje się obrazem — a obrazy sieci neuronowe rozumieją znakomicie.
W praktyce używa się spektrogramu melowego, przeskalowanego tak, jak słyszy ludzkie ucho (jesteśmy czulsi na niskie różnice tonów niż wysokie). Z niego liczy się m.in. MFCC — zwięzły „odcisk palca" barwy dźwięku, od dekad podstawa rozpoznawania mowy i muzyki.
Cechy, których słucha algorytm Na spektrogramie i sygnale liczy się dziesiątki cech:
- Tempo i beat — gdzie wypada puls, ile BPM. - Tonacja i harmonia — dur czy moll, jakie akordy. - Barwa (timbre) — czym różni się skrzypce od syntezatora grającego tę samą nutę. - Energia i dynamika — cichy ambient czy ścianadźwięku. - Danceability / valence — jak „taneczny" i jak „pozytywny" jest utwór.
To właśnie te cechy napędzają radio adaptacyjne i dobór „pod nastrój".
Embedding — zamiana utworu w punkt w przestrzeni Nowoczesne modele idą dalej niż ręcznie liczone cechy. Sieć uczona na milionach nagrań zamienia każdy utwór w embedding: wektor kilkuset liczb, w którym podobne brzmienia leżą blisko siebie. Nie definiujemy z góry „co to gatunek" — model sam układa mapę, na której lo-fi ląduje obok lo-fi, a techno obok techno.
Dzięki temu rekomendacja to często zwykła geometria: „znajdź utwory najbliżej tego, którego właśnie słuchasz". Ta sama sztuczka pozwala szukać muzyki nucąc melodię albo dobierać ścieżkę do nastroju wykrytego z głosu czy kamery.
Dlaczego to ważne dla uczciwego streamingu Skoro maszyna potrafi opisać treść dźwięku, potrafi też odróżnić realne odsłuchanie od sztucznego ruchu: nietypowe wzorce, brak reakcji na muzykę, podejrzanie „idealne" pętle. Analiza sygnału to nie tylko lepsze rekomendacje — to również fundament weryfikacji, dzięki której liczą się prawdziwi słuchacze, a nie boty.
Na wynos Zanim algorytm cokolwiek Ci poleci, wykonuje cichą pracę: fala → spektrogram → cechy → embedding. Im lepiej rozumiemy ten łańcuch, tym mniej „magii", a więcej inżynierii widać w tym, że aplikacja trafia w Twój nastrój. I tym trudniej ją oszukać.