ElevenLabs to platforma AI, która zamienia tekst na mowę brzmiącą jak nagranie żywego lektora. Potrafi sklonować konkretny głos, zdubbingować wideo na inny język i czytać dowolny tekst - w ponad 70 językach, w tym po polsku. Ma darmowy plan i płatne subskrypcje od 6 USD miesięcznie.
W skrócie: to dziś najlepiej brzmiący generator mowy na rynku, a przy okazji jeden z niewielu wielkich sukcesów AI z polskim rodowodem. Firmę założyli w 2022 roku Piotr Dąbkowski i Mateusz Staniszewski - obaj wychowani w Polsce. Poniżej rozkładam na czynniki pierwsze, co to potrafi, ile kosztuje i na co uważać, zanim wygenerujesz pierwszy plik.
Czym jest ElevenLabs
Pod maską ElevenLabs to zestaw modeli generatywnej sztucznej inteligencji wyspecjalizowanych w dźwięku - konkretnie w mowie. Wpisujesz tekst, wybierasz głos, klikasz i dostajesz plik audio, w którym syntetyczny lektor czyta Twoje słowa z intonacją, oddechem i akcentowaniem bliskim człowiekowi. To ta sama rodzina narzędzi generatywnych co generator muzyki Suno czy modele do grafiki pokroju Midjourney, generator efektów dźwiękowych, czytnik długich tekstów (Reader) oraz głosowe agenty konwersacyjne. Wszystko działa w przeglądarce i przez API, bez instalowania czegokolwiek lokalnie.
Firma - formalnie ElevenLabs Inc. z siedzibą w Nowym Jorku i Londynie - powstała z prywatnej frustracji założycieli. Jak podaje ich własna historia, inspiracją było oglądanie kiepsko zdubbingowanych zagranicznych filmów. Sama nazwa to ukłon w stronę Polski: "eleven" to jedenaście, nawiązanie do 11 listopada i Narodowego Święta Niepodległości.
Kto stoi za ElevenLabs i czy to polska firma
To pytanie wraca w wyszukiwarce najczęściej, więc odpowiadam wprost: ElevenLabs jest amerykańską spółką, ale zbudowali ją dwaj Polacy. Piotr Dąbkowski, dziś CTO, wcześniej pracował jako inżynier uczenia maszynowego w Google. Mateusz Staniszewski, CEO, był strategiem wdrożeń w Palantirze. Obaj dorastali w Polsce i to ich wspólny projekt urósł do jednego z najgłośniejszych startupów AI ostatnich lat.
Konkret na temat skali: firma szła od zera do wyceny liczonej w miliardach w niecałe trzy lata. Seria A w czerwcu 2023 to 19 mln USD przy wycenie około 100 mln. Seria B w styczniu 2024 - 80 mln USD, wycena 1,1 mld. Seria C w styczniu 2025 - 180 mln USD. Reuters podał wtedy wycenę 3,3 mld USD, a w lutym 2026 Wall Street Journal pisał o kolejnej rundzie na 500 mln USD. Wśród inwestorów są Andreessen Horowitz i Sequoia Capital - największe nazwiska z Doliny Krzemowej.
Jak działa generowanie mowy (text-to-speech)
Sam proces jest banalnie prosty i sprowadza się do trzech kroków:
- Tekst - wklejasz to, co ma zostać przeczytane. Może być zdanie albo cała książka.
- Głos - wybierasz jeden z ponad 5000 gotowych głosów z biblioteki albo własny, sklonowany. Każdy głos ma inny timbre, wiek i akcent.
- Generacja - model zamienia tekst na plik audio (MP3 lub, w wyższych planach, PCM w wyższej jakości).
W praktyce różnicę między ElevenLabs a starszymi syntezatorami mowy słychać w pierwszej sekundzie. Klasyczny lektor komputerowy czyta płaską, robotyczną intonacją. Tutaj model dobiera akcenty logiczne, robi mikropauzy, oddaje emocje - potrafi brzmieć spokojnie, z entuzjazmem albo dramatycznie. Za jakość odpowiadają kolejne generacje modeli: wielojęzyczny Multilingual v2, nowszy Eleven v3 oraz szybkie warianty Flash i Turbo, zoptymalizowane pod niską latencję przy pracy przez API.
Trade-off: im nowszy i bardziej ekspresyjny model, tym większe zużycie zasobów. W rozliczeniu ElevenLabs jeden znak tekstu to zwykle jeden kredyt, ale warianty Flash i Turbo przez API potrafią kosztować od 0,5 do 1 kredytu za znak. Przy długich materiałach tę różnicę realnie widać na rachunku.
Klonowanie głosu - Instant i Professional
To funkcja, która budzi najwięcej emocji i najwięcej pytań. ElevenLabs oferuje dwa poziomy klonowania:
- Instant Voice Cloning - tworzy kopię głosu z krótkiej próbki (kilka minut nagrania). Dostępne już od planu Starter. Efekt jest dobry, choć przy dłuższych tekstach słychać, że to nie oryginał.
- Professional Voice Cloning - wymaga większej ilości czystego materiału (zwykle kilkudziesięciu minut) i dłuższego treningu, ale odwzorowanie jest znacznie wierniejsze. Odblokowuje je plan Creator.
W praktyce klonowanie głosu to najmocniejszy i najbardziej wrażliwy element platformy. Z jednej strony pozwala youtuberowi nagrać lektorski podkład własnym głosem bez siadania do mikrofonu, a firmie utrzymać jeden spójny głos marki we wszystkich materiałach. Z drugiej to dokładnie ta sama technologia, która umożliwia deepfake głosowy. Do tego wracam w sekcji o prawie.
Dubbing, Speech to Text i pozostałe narzędzia
Poza mową ElevenLabs urósł do całego kombajnu audio. Najczęściej używane moduły to:
-
Dubbing Studio - bierze wideo w jednym języku i tworzy ścieżkę lektorską w innym, zachowując barwę oryginalnego głosu. Automatyzuje to, na co wcześniej trzeba było studia i aktorów.
-
Speech to Text - transkrypcja, czyli odwrotność TTS: z nagrania robi tekst. Koszt to około 330 kredytów za minutę audio.
-
Eleven Music - generator utworów muzycznych z opisu tekstowego, konkurencja dla Suno:
-
Free - 0 USD, 10 000 kredytów miesięcznie. Działa Text to Speech i większość narzędzi, ale bez licencji komercyjnej.
-
Starter - 6 USD, 30 000 kredytów. Odblokowuje licencję komercyjną i Instant Voice Cloning.
-
Creator - 22 USD (11 USD w pierwszym miesiącu), 121 000 kredytów. Dochodzi Professional Voice Cloning.
-
Pro - 99 USD, 600 000 kredytów, wyższa jakość audio przez API.
-
Scale - 299 USD, 1,8 mln kredytów, praca zespołowa.
-
Business - 990 USD, 6 mln kredytów.
-
Enterprise - wycena indywidualna, umowy DPA/SLA, HIPAA.
Trade-off darmowego planu: masz pełnię funkcji do przetestowania, ale bez prawa do komercyjnego użycia i z ograniczoną pulą kredytów. 10 000 kredytów to z grubsza kilkanaście minut wygenerowanej mowy - wystarczy, żeby ocenić jakość, za mało do regularnej pracy. Pro tip: przy rozliczeniu rocznym płacisz za 10 miesięcy zamiast 12, więc jeśli już wiesz, że narzędzie zostaje z Tobą na dłużej, plan roczny wychodzi taniej.
Zastosowania - komu to realnie służy
Bez owijania: ElevenLabs najmocniej sprawdza się tam, gdzie potrzebujesz dużo dobrej mowy szybko i tanio. Najczęstsze scenariusze:
- Twórcy contentu - lektor do filmów na YouTube, TikToka, reelsów, bez nagrywania się mikrofonem.
- Audiobooki i podcasty - zamiana tekstu w gotową ścieżkę, także głosem autora po sklonowaniu.
- E-learning i szkolenia - narracja do kursów i prezentacji, łatwa do aktualizacji (poprawiasz tekst, regenerujesz audio).
- Firmy i produkty - jednolity głos marki, głosowe boty, dostępność dla osób niewidomych.
- Lokalizacja - dubbing materiałów na kilka języków bez osobnej ekipy lektorów.
To narzędzie z rodziny generatywnego AI, które najlepiej poznaje się w praktyce - podobnie jak inne narzędzia AI do codziennej pracy i Mateusz Staniszewski (wcześniej Palantir). Obaj wychowali się w Polsce, a nazwa firmy nawiązuje do 11 listopada, polskiego Święta Niepodległości. To najczęściej cytowany polski sukces w globalnym AI.
Czy ElevenLabs jest darmowy?
Tak, ElevenLabs ma darmowy plan z pulą 10 000 kredytów miesięcznie - to około kilkunastu minut wygenerowanej mowy. Działa w nim Text to Speech i większość narzędzi, ale bez licencji komercyjnej. Do użytku zarobkowego potrzebujesz płatnego planu, który zaczyna się od 6 USD miesięcznie (Starter).
Jak sklonować własny głos w ElevenLabs?
Klonowanie głosu wymaga płatnego planu. Instant Voice Cloning (od planu Starter) tworzy kopię z kilku minut nagrania, a Professional Voice Cloning (od planu Creator) daje wierniejszy efekt, ale potrzebuje więcej czystego materiału. Klonować wolno wyłącznie własny głos lub cudzy za wyraźną zgodą.
Czy ElevenLabs mówi po polsku?
Tak. Polski jest jednym z ponad 70 obsługiwanych języków. Modele wielojęzyczne czytają po polsku z naturalną intonacją i poprawnym akcentem, radząc sobie z odmianą i miękkimi głoskami. Działa to zarówno w Text to Speech, jak i w dubbingu oraz przy sklonowanym własnym głosie.
Czy mogę używać ElevenLabs komercyjnie?
Tak, ale dopiero od planu płatnego. Darmowy plan Free nie obejmuje licencji komercyjnej - materiały z niego nie mogą być wykorzystywane zarobkowo. Najtańszy plan z prawami komercyjnymi to Starter za 6 USD miesięcznie. Przy klonowaniu cudzego głosu dodatkowo potrzebujesz zgody tej osoby.
Czy klonowanie głosu przez AI jest legalne?
Samo klonowanie głosu jest legalne, jeśli klonujesz własny głos lub masz zgodę osoby, której głos dotyczy. Bez zgody może naruszać dobra osobiste, prawo do wizerunku głosowego oraz RODO. Użycie sklonowanego głosu do podszywania się pod kogoś lub oszustwa jest przestępstwem, niezależnie od użytego narzędzia.