Modele

Ten przewodnik przedstawia wszystkie modele dostępne w interfejsie Gemini API.


Gemini 3

Stabilny

Podgląd


Gemini 2.5 Flash

Gemini 2.5 Flash

Nasz najlepszy model pod względem stosunku ceny do wydajności w przypadku zadań o dużej skali i krótkim czasie oczekiwania, które wymagają rozumowania.

Nano Banana

Najnowocześniejsze natywne generowanie i edytowanie obrazów zaprojektowane pod kątem szybkiej pracy twórczej.

Gemini 2.5 Flash Live (wersja testowa)

Zoptymalizowany pod kątem agentów konwersacyjnych w czasie rzeczywistym z natywnym strumieniowaniem dźwięku poniżej sekundy.

Gemini 2.5 Flash TTS (wersja testowa)

Generowanie dźwięku za pomocą funkcji zamiany tekstu na mowę z możliwością sterowania stylem i tempem.


Gemini 2.5 Flash-Lite

Gemini 2.5 Flash-Lite

Najszybszy i najbardziej ekonomiczny model multimodalny z rodziny 2.5.


Gemini 2.5 Pro

Gemini 2.5 Pro

Nasz najbardziej zaawansowany model do złożonych zadań, który ma zaawansowane możliwości rozumowania i kodowania.

Gemini 2.5 Pro TTS (wersja testowa)

Synteza mowy o wysokiej jakości zoptymalizowana pod kątem jakości w uporządkowanych procesach, takich jak podcasty i audiobooki.


Modele audio

Ta sekcja zawiera wszystkie modele audio, w tym te, które mogą być już wymienione w innych sekcjach.

Gemini 3.1 Flash Live wersja testowa

Nasz model audio-to-audio (A2A) o wysokiej jakości i krótkim czasie oczekiwania, zaprojektowany pod kątem dialogów w czasie rzeczywistym i aplikacji AI opartych na głosie.

Gemini 3.1 Flash TTS (wersja testowa)

Wydajne generowanie mowy z krótkim czasem oczekiwania, naturalnymi wynikami, sterowalnymi promptami i nowymi ekspresyjnymi tagami audio, które umożliwiają precyzyjne sterowanie narracją.

Gemini 2.5 Flash Live (wersja testowa)

Nasz flagowy model Live API do dwukierunkowych agentów głosowych i wideo z krótkim czasem oczekiwania oraz natywnym rozumowaniem audio.

Gemini 2.5 Flash TTS (wersja testowa)

Szybka i sterowalna funkcja zamiany tekstu na mowę do aplikacji o krótkim czasie oczekiwania i niskich kosztach oraz asystentów w czasie rzeczywistym.

Gemini 2.5 Pro TTS (wersja testowa)

Synteza mowy o wysokiej jakości zoptymalizowana pod kątem jakości w uporządkowanych procesach, takich jak podcasty i audiobooki.


Generatywne modele multimedialne

Ta sekcja zawiera wszystkie generatywne modele multimedialne, w tym te, które mogą być już wymienione w innych sekcjach.

Nano Banana 2

Wydajne tworzenie wizualne na dużą skalę, które łączy inteligencję serii Gemini 3 z błyskawiczną szybkością generowania.

Nano Banana 2 Lite

Zaprojektowany jako specjalista od wydajności w rodzinie modeli generowania obrazów, oferujący bardzo małe opóźnienie oraz ekonomiczne generowanie i edytowanie obrazów.

Veo 3.1 (wersja testowa)

Najnowocześniejsze generowanie filmów kinowych z zaawansowanymi opcjami kreatywnymi i natywnie zsynchronizowanym dźwiękiem.

Nano Banana Pro

Profesjonalny silnik projektowy z rdzeniem rozumującym, który umożliwia tworzenie wizualizacji 4K o jakości studyjnej, złożonych układów i precyzyjnego renderowania tekstu.

Veo 3.1 Lite (wersja testowa)

Wydajne, tanie i przyjazne dla deweloperów generowanie i edytowanie filmów oraz sterowanie kinowe z rodziny Veo 3.1.

Gemini Omni Flash (wersja testowa)

Szybkie, konwersacyjne generowanie i edytowanie filmów. Przekształcaj tekst i obrazy w filmy oraz dopracowuj wyniki za pomocą języka naturalnego.

Nano Banana

Najnowocześniejsze natywne generowanie i edytowanie obrazów zaprojektowane pod kątem szybkiej pracy twórczej.

Imagen 4 (wycofany)

Model zamiany tekstu na obraz, który umożliwia szybkie i bardzo szybkie generowanie oraz wyjątkową przejrzystość w rozdzielczości do 2K.


Modele generowania muzyki

Ta sekcja zawiera wszystkie modele generowania muzyki, w tym te, które mogą być już wymienione w innych sekcjach.

Lyria 3 Pro (wersja testowa)

Nasz flagowy model generowania muzyki, zoptymalizowany pod kątem pełnych utworów o złożonej spójności strukturalnej.

Lyria 3 Clip (wersja testowa)

Zoptymalizowany pod kątem generowania krótkich klipów muzycznych, pętli i podglądów do 30 sekund.

Lyria RealTime (wersja eksperymentalna)

Model generowania muzyki o wysokiej jakości, który zapewnia szczegółową kontrolę kreatywną i możliwości strumieniowania w czasie rzeczywistym.


Modele narzędzi i agentów

Korzystanie z komputera wersja testowa

Model specjalistyczny, który może „widzieć” ekran cyfrowy i wykonywać działania w interfejsie użytkownika, takie jak klikanie, pisanie i nawigowanie, aby zautomatyzować złożone zadania w przeglądarce.

Deep Research w Gemini (wersja testowa)

Model agentowy, który autonomicznie planuje i wykonuje wieloetapowe badania w setkach źródeł, aby tworzyć interaktywne raporty z cytatami.

Deep Research Max w Gemini (wersja testowa)

Maksymalna kompleksowość w przypadku automatycznego zbierania i syntezy kontekstu w setkach źródeł.

Agent Antigravity (wersja testowa)

Zarządzany agent do zwykłych obciążeń, który autonomicznie planuje, wnioskuje, uruchamia kod, zarządza plikami i przegląda internet w bezpiecznej, odizolowanej piaskownicy Linux.


Modele zadań specjalistycznych

Gemini Embedding 2

Nasz pierwszy model reprezentacji właściwościowych multimodalnych, który mapuje tekst, obrazy, filmy, dźwięk i pliki PDF w ujednoliconej przestrzeni reprezentacji właściwościowych na potrzeby zaawansowanego wyszukiwania semantycznego i systemów RAG.

Gemini Embedding

Reprezentacje wektorowe o dużej liczbie wymiarów na potrzeby zaawansowanego wyszukiwania semantycznego, klasyfikacji tekstu i systemów RAG.

Gemini Robotics-ER 1.6(wersja testowa)

Zaawansowany model rozumowania ucieleśnionego, który rozumie przestrzenie fizyczne i planuje wieloetapowe zadania dla agentów robotycznych z nowymi możliwościami, takimi jak odczytywanie instrumentów oraz ulepszone rozumowanie przestrzenne i fizyczne.


Poprzednie modele

Wyłączenie Gemini 2.0 Flash

Nasz model roboczy drugiej generacji z funkcjami nowej generacji i ulepszonymi możliwościami, w tym większą szybkością, natywnym korzystaniem z narzędzi i oknem kontekstu o wielkości 1 mln tokenów.

Wyłączenie Gemini 2.0 Flash-Lite

Nasz najszybszy model drugiej generacji, zoptymalizowany pod kątem oszczędności i krótkiego czasu oczekiwania.

Wyłączenie Gemini 3.1 Flash-Lite (wersja testowa)

Nasz najbardziej ekonomiczny model multimodalny, który zapewnia najszybszą wydajność w przypadku zadań o wysokiej częstotliwości i niewielkiej złożoności.

Wyłączenie Gemini 3 Pro (wersja testowa)

Nasz najnowocześniejszy model rozumowania z zaawansowanym rozpoznawaniem multimodalnym.


Wzorce nazw wersji modelu

Modele Gemini są dostępne w wersjach stabilnych, testowych, najnowszych lub eksperymentalnych.

Stabilny

Wskazuje konkretny model stabilny. Modele stabilne zwykle się nie zmieniają. Większość aplikacji produkcyjnych powinna używać konkretnego modelu stabilnego.

Na przykład: gemini-3.6-flash.

Podgląd

Wskazuje model w wersji testowej, który może być używany w środowisku produkcyjnym. Modele w wersji testowej zwykle mają włączone rozliczenia, mogą mieć bardziej restrykcyjne limity żądań i zostaną wycofane z co najmniej 2-tygodniowym wyprzedzeniem.

Na przykład: gemini-2.5-flash-preview-09-2025.

Najnowsze

Wskazuje najnowszą wersję konkretnego wariantu modelu. Może to być wersja stabilna, testowa lub eksperymentalna. Ten alias będzie automatycznie zamieniany na każdą nową wersję konkretnego wariantu modelu. W przypadku zmian powodujących niezgodność wsteczną na 2 tygodnie przed zmianą wersji, która jest starsza od najnowszej, wyślemy e-maila z powiadomieniem.

Na przykład: gemini-flash-latest.

Wersja eksperymentalna

Wskazuje model eksperymentalny, który zwykle nie nadaje się do użytku produkcyjnego i ma bardziej restrykcyjne limity żądań. Modele eksperymentalne udostępniamy, aby zbierać opinie i szybko udostępniać deweloperom najnowsze aktualizacje.

Modele eksperymentalne nie są stabilne, a dostępność punktów końcowych modelu może się zmieniać.

Wycofanie modeli

Więcej informacji o wycofywaniu modeli znajdziesz na stronie Wycofanie Gemini.