W skrócie: Whisper to otwarty model transkrypcji od OpenAI, który uruchomisz na własnym komputerze - bez chmury, bez abonamentu, bez wysyłania nagrań na cudzy serwer. Instalujesz jedną paczkę, podajesz plik audio i dostajesz tekst, także po polsku. Poniżej pokazuję jak to zrobić.
Whisper lokalnie kontra transkrypcja w chmurze
Najważniejsze rozróżnienie na start: "Whisper" to jedno słowo, ale kryją się pod nim dwie różne rzeczy. Pierwsza to model open-source, który OpenAI udostępniło we wrześniu 2022 na licencji MIT - ściągasz go i odpalasz u siebie za darmo. Druga to dziesiątki płatnych narzędzi SaaS (WhisperTranscribe, Speechify i podobne), które ten sam model owijają w ładny interfejs i pobierają opłatę. Ten poradnik jest o pierwszej wersji - tej, która działa lokalnie.
Trade-off widać najlepiej w tabeli:
| Kryterium | Whisper lokalnie | Transkrypcja w chmurze (SaaS / API) |
|---|---|---|
| Gdzie lądują nagrania | zostają na Twoim dysku | wysyłasz je na serwer dostawcy |
| Koszt | darmowy (prąd i Twój sprzęt) | abonament lub rozliczenie za minutę |
| Limit minut | brak | zwykle limitowany planem |
| Internet | działa offline | wymagany |
| Próg wejścia | trzeba raz zainstalować | rejestracja i gotowe |
Konkret dla firm: jeśli transkrybujesz rozmowy z klientami, nagrania spotkań albo materiały objęte tajemnicą, lokalny Whisper to nie kwestia oszczędności, tylko kontroli nad danymi. Nagranie nie opuszcza Twojej maszyny. Dla porównania cennik OpenAI API liczy Whisper po 0,006 USD za minutę (0,36 USD za godzinę) - przy pojedynczych plikach to grosze, ale przy setkach godzin audio miesięcznie rachunek rośnie, a dane i tak wychodzą na zewnątrz.
Po polsku Whisper radzi sobie dobrze
Whisper jest wielojęzyczny - rozpoznaje ponad 90 języków, w tym polski. W praktyce polska transkrypcja z modelu large-v3 jest naprawdę przyzwoita: łapie interpunkcję, radzi sobie z nazwami własnymi i nie gubi się przy szumie tła czy potocznej mowie. Mniejsze modele (tiny, base) po polsku wypadają słabiej - myślą się w odmianach i literują nazwy fonetycznie. Pro tip: do polskiego zawsze celuj w large-v3 albo nowszy large-v3-turbo (z października 2024), a nie w wersje "small". Różnica w jakości jest odczuwalna od pierwszego zdania.
Trzy warianty Whisper - który wybrać
Pod maską to wciąż ten sam model, ale masz trzy różne sposoby, żeby go uruchomić. Wybór zależy od tego, co masz w komputerze.
- openai-whisper - referencyjna implementacja w PyTorch, prosto od OpenAI. Najłatwiejsza do postawienia, najlepsza na start. Lubi kartę graficzną NVIDIA, ale ruszy też na samym procesorze (wolniej).
- whisper.cpp - port do C/C++ autorstwa Georgiego Gerganova, oparty o GGML. Nie wymaga Pythona ani CUDA, świetnie chodzi na CPU i szczególnie dobrze na Apple Silicon (Metal, Core ML). To wybór na Maca albo słabszy sprzęt bez dedykowanej grafiki.
- faster-whisper - reimplementacja na silniku CTranslate2 od SYSTRAN. Według projektu jest około czterokrotnie szybsza od referencyjnej wersji przy mniejszym zużyciu pamięci, przy tej samej dokładności. To wybór, gdy przerabiasz dużo materiału i zależy Ci na czasie.
W skrócie: zaczynasz od openai-whisper, przesiadasz się na whisper.cpp jeśli siedzisz na Macu lub CPU, a na faster-whisper gdy transkrybujesz hurtowo.
Wymagania sprzętowe - ile VRAM potrzebujesz
Bez owijania: głównym ogranicznikiem jest pamięć karty graficznej. Im większy model, tym lepsza jakość, ale i większy apetyt na VRAM. Zależność wg dokumentacji Whisper wygląda tak:
| Model | Potrzebny VRAM | Względna szybkość |
|---|---|---|
| tiny | ~1 GB | ~10x |
| base | ~1 GB | ~7x |
| small | ~2 GB | ~4x |
| medium | ~5 GB | ~2x |
| large | ~10 GB | 1x |
W praktyce: karta z 8-12 GB VRAM spokojnie uciągnie large-v3 i to jest sweet spot do polskiej transkrypcji. Nie masz mocnej grafiki? whisper.cpp przemieli audio na samym procesorze - wolniej, ale bez zakupów. Jeśli dobierasz sprzęt pod lokalne modele w ogóle, rozpisałem to szerzej w tekście o tym, jaką kartę graficzną wybrać do lokalnego AI.
1. Zainstaluj FFmpeg. Na Ubuntu/Debian sudo apt install ffmpeg, na macOS brew install ffmpeg, na Windows przez winget install ffmpeg albo pobierając binarkę.
2. Zainstaluj Whisper. Jedna komenda:
pip install -U openai-whisper
3. Przetranskrybuj nagranie. Wskaż plik, język i model:
whisper nagranie.mp3 --language Polish --model large-v3 --output_format srt
Whisper przy pierwszym uruchomieniu pobierze wagi modelu (dla large to kilka GB), a potem wypluje transkrypcję. Flaga --output_format srt daje od razu plik napisów z timestampami - wygodne do wideo. Dostępne formaty to między innymi txt, srt, vtt i json.
Sprawdź sam: puść na 2-minutowym nagraniu z modelem small, żeby zobaczyć, że pipeline działa, a dopiero potem przełącz na large-v3 do właściwej roboty.
whisper.cpp - wariant bez Pythona
Na Macu albo słabszym sprzęcie zbudujesz whisper.cpp z paczki źródłowej. Uwaga: whisper.cpp chce audio w formacie WAV 16 kHz mono, więc pliki konwertujesz FFmpegiem:
ffmpeg -i nagranie.mp3 -ar 16000 -ac 1 nagranie.wav
./build/bin/whisper-cli -m models/ggml-large-v3-turbo.bin -f nagranie.wav -l pl
faster-whisper - wariant wydajnościowy
faster-whisper wołasz z poziomu Pythona, co daje pełną kontrolę nad przetwarzaniem wsadowym:
from faster_whisper import WhisperModel
model = WhisperModel("large-v3", device="cuda", compute_type="float16")
segments, info = model.transcribe("nagranie.mp3", language="pl")
for s in segments:
print(s.text)
Na karcie NVIDIA ustawiasz device="cuda", na CPU zmieniasz na device="cpu" i compute_type="int8".
Whisper w szerszym lokalnym stacku AI
Transkrypcja to zwykle jeden klocek większej układanki. Skoro masz już sprzęt pod lokalne modele, warto go wykorzystać do reszty. Ten sam komputer, na którym transkrybujesz, uciągnie lokalny model językowy przez Ollamę, a jeśli interesuje Cię lokalne AI po stronie grafiki, opisałem osobno generowanie obrazów przez Stable Diffusion na własnym sprzęcie - uruchamiasz go lokalnie bez żadnych opłat i bez limitu minut. Płatne bywają narzędzia SaaS zbudowane na Whisper oraz OpenAI API, które liczy 0,006 USD za minutę. Wersja lokalna nie kosztuje nic poza prądem i Twoim sprzętem.
Czy transkrypcja Whisper działa offline? Tak. Po jednorazowym pobraniu wag modelu Whisper działa całkowicie bez internetu. Nagrania są przetwarzane na Twoim komputerze i nigdzie nie wychodzą, co jest kluczowe przy danych wrażliwych. Internet potrzebny jest tylko raz - do ściągnięcia modelu przy pierwszym uruchomieniu.
Jak dobrze Whisper radzi sobie z polskim? Bardzo dobrze, pod warunkiem że użyjesz modelu large-v3 lub large-v3-turbo. Poprawnie stawia interpunkcję, rozpoznaje nazwy własne i znosi szum tła oraz mowę potoczną. Mniejsze modele (tiny, base) po polsku mylą odmiany, dlatego do poważnej pracy warto celować w największą wersję.
Który wariant Whisper wybrać - openai-whisper, whisper.cpp czy faster-whisper? Na start openai-whisper, bo instaluje się jedną komendą. whisper.cpp wybierz na Maca albo komputer bez mocnej karty graficznej, bo świetnie chodzi na CPU i Apple Silicon. faster-whisper bierz, gdy przerabiasz dużo materiału - według projektu jest około czterokrotnie szybszy przy tej samej jakości.
Jaki sprzęt potrzebuję, żeby uruchomić Whisper? Do modelu large-v3 komfortowo wystarcza karta graficzna z 8-12 GB VRAM. Mniejsze modele zmieszczą się w 1-2 GB. Bez dedykowanej grafiki Whisper policzy transkrypcję na samym procesorze - najwygodniej przez whisper.cpp - tyle że wolniej niż na GPU.
Czy używanie Whisper jest legalne? Tak. Whisper to oprogramowanie open-source na licencji MIT, więc możesz go używać komercyjnie i prywatnie bez opłat licencyjnych. Pamiętaj tylko, że transkrybowane nagrania podlegają osobnym przepisom - jeśli zawierają dane osobowe, obowiązuje Cię RODO niezależnie od użytego narzędzia.