Konfiguracja agenta do kodowania i materiały dla deweloperów

Agenty AI do kodowania korzystają z danych treningowych, które kończą się w określonym dniu. Z tego powodu agenci często sugerują wycofane modele (gemini-1.5), starsze pakiety SDK (google-generativeai) lub nieaktualne wzorce kodu.

Połączenie agenta z oficjalnymi zasobami dla programistów Gemini pomaga mu pisać dokładny kod z użyciem bieżących modeli, pakietu google-genai SDK i interfejsu Interactions API.

Możesz przyznać agentowi do kodowania dostęp do dokumentacji i zasad Gemini na 4 sposoby:

Podsumowanie zasobów agenta

Zasób Co zapewnia Dostępność
Umiejętności agenta Gemini Szczegółowe reguły, wzorce pakietu SDK i skrypty pomocnicze dotyczące konkretnych funkcji (gemini-api-dev, gemini-live-api-dev, gemini-omni-flash-api). Jest wstępnie zainstalowany w AI Studio Build. Możesz go zainstalować za pomocą skills.sh, Context7 lub zarządzanych agentów.
Serwer MCP Gemini Docs Wyszukiwanie na żywo (gemini_search_docs) i czytanie całej strony (gemini_get_doc) w całej dokumentacji. Obsługiwane w Claude Code, Cursor, OpenAI Codex i VS Code.
Wtyczka Gemini API Pakiet łączony zawierający oficjalne umiejętności Gemini, serwer MCP Dokumentów i narzędzia klucza interfejsu API. Antigravity.
Dokumenty w formacie do odczytu maszynowego Oczyść strony Markdown i llms.txt indeksy. Wszystkie strony dokumentacji w domenie ai.google.dev/gemini-api/docs.

Instalowanie umiejętności agenta Gemini

Umiejętności agenta zapewniają agentowi do kodowania reguły proceduralne, aktualne nazwy modeli i wzorce kodu pakietu SDK. Zamiast dodawać do prompta długich instrukcji, Twój agent wczytuje każdą umiejętność tylko wtedy, gdy jest to potrzebne. Dzięki temu Twój agent uniknie przestarzałych pakietów SDK i będzie korzystać z nowoczesnych wzorców Gemini.

Umiejętności działają razem z serwerem MCP Dokumentów Gemini. Jeśli agent nie ma zainstalowanego serwera MCP, usługa przełącza się na llms.txt. Aby dowiedzieć się więcej o tym, jak działają umiejętności, przeczytaj przewodnik po umiejętnościach interfejsu Gemini API.

Instalowanie za pomocą interfejsu wiersza poleceń (skills.sh lub Context7)

Zainstaluj umiejętności za pomocą skryptu skills.sh (zalecane) lub Context7:

# List all available skills in the repository
npx skills add google-gemini/gemini-skills --list

# Install a specific skill globally with skills.sh
npx skills add google-gemini/gemini-skills --skill <skill-name> --global

# Or install with Context7
npx ctx7 skills install /google-gemini/gemini-skills <skill-name>

Dostępne umiejętności

gemini-api-dev

Umiejętność tworzenia aplikacji za pomocą interfejsu API Interactions i oficjalnych pakietów SDK Gemini API (google-genai dla Pythona i @google/genai dla TypeScript). Ta umiejętność obejmuje:

  • generowanie tekstu, czat wieloetapowy, przesyłanie strumieniowe, dane wyjściowe strukturalne i wywoływanie funkcji;
  • Generowanie obrazów, zamiana tekstu na mowę (TTS) i dane wejściowe multimodalne
  • Zarządzanie stanem rozmowy po stronie serwera, wykonywanie w tle, Deep Research i zarządzani agenci
  • Obecne nazwy modeli i migracja starszego kodu generateContent lub google-generativeai
npx skills add google-gemini/gemini-skills --skill gemini-api-dev --global

gemini-live-api-dev

Umiejętność tworzenia aplikacji do strumieniowania dźwięku i wideo w czasie rzeczywistym za pomocą interfejsu Gemini Live API. Ta umiejętność obejmuje:

  • zarządzanie sesjami WebSocket, tymczasowe tokeny klienta i wznawianie sesji;
  • Strumieniowanie dźwięku, wideo i tekstu z wykrywaniem aktywności głosowej (VAD) i obsługą przerywania
  • Uzasadnianie w tle (rozszerzone myślenie), nieblokujące asynchroniczne wywołania narzędzi, transkrypcja i tłumaczenie mowy na żywo
npx skills add google-gemini/gemini-skills --skill gemini-live-api-dev --global

gemini-omni-flash-api

Umiejętność generowania i edytowania filmów za pomocą Gemini Omni Flash przy użyciu interfejsu Interactions API. Zawiera skrypty pomocnicze (upload_file.py, generate_video.py, prep_video.py, inspect_video.py) i obejmuje:

  • Generowanie filmów na podstawie tekstu i tworzenie promptów
  • Przejścia między pierwszą a ostatnią klatką i generowanie filmów na podstawie klatek referencyjnych
  • Rozszerzenia wideo i przepływy pracy związane z wstępnym przetwarzaniem multimediów
npx skills add google-gemini/gemini-skills --skill gemini-omni-flash-api --global

Montowanie umiejętności w zarządzanych agentach

Gdy uruchamiasz zdalnie zarządzane agenty za pomocą interfejsu Interactions API, możesz zamontować repozytorium google-gemini/gemini-skills w przestrzeni roboczej agenta. Szczegółowe informacje znajdziesz w przewodniku po umiejętnościach interfejsu Gemini API:

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    agent="antigravity-preview-09-2026",
    input="Build a script that generates a 5-second video of a neon cityscape.",
    environment={
        "type": "remote",
        "sources": [
            {
                "type": "repository",
                "source": "https://github.com/google-gemini/gemini-skills",
                "target": ".agents",
            }
        ],
    },
)

Łączenie serwera MCP Gemini Docs

Publiczny serwer MCP Dokumentów Gemini (https://gemini-api-docs-mcp.dev) zapewnia agentowi dostęp na żywo do całej witryny z dokumentacją. Agent może wyszukiwać i czytać strony dokumentacji, aby sprawdzać schematy żądań, limity modeli i nowe funkcje:

  • gemini_search_docs: wyszukuje w dokumentacji interfejsu Gemini API według tematu lub zapytania.
  • gemini_get_doc: Odczytuje pełną treść w formacie Markdown na określonej stronie dokumentacji.

Szybka konfiguracja

Uruchom to polecenie w terminalu lub w katalogu głównym projektu, aby automatycznie skonfigurować wykryte agenty do kodowania:

npx add-mcp "https://gemini-api-docs-mcp.dev"

Konfiguracja według środowiska

Claude Code

Uruchom w terminalu:

$ claude mcp add --transport http geminiDocs https://gemini-api-docs-mcp.dev

Kursor

Dodaj do ~/.cursor/mcp.json (globalnie) lub .cursor/mcp.json (w projekcie):

{
  "mcpServers": {
    "geminiDocs": {
      "url": "https://gemini-api-docs-mcp.dev"
    }
  }
}

OpenAI Codex

Uruchom w terminalu:

$ codex mcp add geminiDocs --url https://gemini-api-docs-mcp.dev

Możesz też dodać do ~/.codex/config.toml:

[mcp_servers.geminiDocs]
url = "https://gemini-api-docs-mcp.dev"

VS Code (Copilot)

Dodaj do .vscode/mcp.json w obszarze roboczym:

{
  "servers": {
    "geminiDocs": {
      "type": "http",
      "url": "https://gemini-api-docs-mcp.dev"
    }
  }
}

Wtyczka Gemini API

Jeśli używasz Antigravity, wtyczka Gemini API to najszybszy sposób na skonfigurowanie obszaru roboczego. Zawiera serwer MCP Dokumentów Gemini, wszystkie oficjalne umiejętności Gemini (gemini-api-dev, gemini-live-api-dev, gemini-omni-flash-api) i narzędzia klucza interfejsu API w jednym pakiecie do pobrania.

  • Instalacja w Antigravity (interfejs): otwórz Ustawienia > Dostosowywanie > Twórz za pomocą wtyczek Google i pobierz Gemini API.
  • Instalacja za pomocą interfejsu wiersza poleceń: bash agy plugin install https://github.com/google-gemini/gemini-skills

Dokumentacja czytelna dla komputerów

Standardowe strony internetowe zawierają tagi HTML, paski nawigacyjne i skrypty, które zajmują miejsce w oknie kontekstu. ai.google.dev udostępnia punkty końcowe czytelne dla maszyn, dzięki czemu agenci i skrypty mogą pobierać czysty kod Markdown bezpośrednio:

Zalecane reguły projektu (AGENTS.md)

Plik reguł projektu (AGENTS.md, .cursorrules lub CLAUDE.md) zawiera podstawowe reguły, które są wczytywane na początku każdej sesji agenta. Dodaj te wytyczne do katalogu głównego projektu, aby agenci kodujący domyślnie korzystali z bieżących modeli i pakietów SDK:

# Gemini API Guidelines

- Before writing Gemini API code, consult the `geminiDocs` MCP server (`gemini_search_docs` / `gemini_get_doc`) or `https://ai.google.dev/gemini-api/docs/llms.txt`.
- Always use the current Gemini API SDK (`google-genai` for Python, `@google/genai` for TypeScript/JavaScript). Never use legacy SDKs (`google-generativeai` or `@google/generative-ai`).
- Use the Interactions API (`client.interactions.create`) for new applications unless a specific feature requires `generateContent`.
- Use current recommended models (see https://ai.google.dev/gemini-api/docs/models) and avoid deprecated models.

Sprawdzanie i rozwiązywanie problemów

Sprawdzanie konfiguracji

Aby przetestować konfigurację, zapytaj asystenta kodowania:

Look up the request schema for the Gemini Interactions API in the documentation.

Skonfigurowany agent będzie używać gemini_search_docs na geminiDocs serwerze MCP i pisać kod za pomocą client.interactions.create z pakietem SDK google-genai lub @google/genai.

Polecenia stanu

Środowisko Weryfikacja MCP Weryfikacja umiejętności
Claude Code Uruchom /mcp Uruchom /skills
Kursor Otwórz Ustawienia > Funkcje > MCP. Otwórz Ustawienia > Reguły.
OpenAI Codex Uruchom codex mcp list Sprawdź .codex/skills/ lub ~/.codex/skills/
Antigravity Otwórz Dostosowywanie > Połączenia. Otwórz Dostosowania > Reguły lub uruchom /skills list
VS Code (Copilot) Otwórz Rozszerzenia > MCP lub panel wyjściowy. W Copilot Chat kliknij Wybierz narzędzia.

Rozwiązywanie problemów

  • Nie wykryto umiejętności ani serwera MCP: ponownie uruchom edytor (Cursor lub VS Code) lub sesję terminala (Claude Code lub Codex). Większość agentów wczytuje serwery MCP i umiejętności tylko podczas uruchamiania.
  • Konflikt umiejętności globalnej: jeśli Twój agent ignoruje zainstalowaną globalnie umiejętność, zainstaluj ją w katalogu głównym projektu bez --global: bash npx skills add google-gemini/gemini-skills --skill gemini-api-dev
  • Zignorowane reguły: upewnij się, że plik AGENTS.md, .cursorrules lub CLAUDE.md znajduje się w katalogu głównym projektu.

Co dalej?