הגדרות בטיחות

ממשק ה-API של Gemini מספק הגדרות בטיחות שניתן להתאים במהלך שלב בניית האב-טיפוס כדי לקבוע אם היישום שלך דורש תצורת בטיחות מגבילה יותר או פחות. באפשרותך להתאים הגדרות אלו על פני ארבע קטגוריות סינון כדי להגביל או לאפשר סוגים מסוימים של תוכן.

מדריך זה מכסה כיצד ממשק ה-API של Gemini מטפל בהגדרות בטיחות וסינון וכיצד ניתן לשנות את הגדרות הבטיחות עבור האפליקציה שלך.

מסנני בטיחות

מסנני הבטיחות המתכווננים של ממשק ה-API של Gemini מכסים את הקטגוריות הבאות:

קטגוריה תיאור
הטרדה הערות שליליות או מזיקות המכוונות לזהות ו/או למאפיינים מוגנים.
דברי שטנה תוכן גס רוח, חסר כבוד או חילול קודש.
תוכן מיני בוטה מכיל התייחסויות למעשים מיניים או לתוכן מגונה אחר.
תוכן מסוכן מקדם, מקל או מעודד מעשים מזיקים.

קטגוריות אלה מוגדרות בHarmCategory. באפשרותך להשתמש במסננים אלה כדי להתאים את מה שמתאים למקרה השימוש שלך. לדוגמה, אם אתם בונים דיאלוגים במשחקי וידאו, ייתכן שתראו שזה מקובל לאפשר תוכן נוסף שמדורג כמסוכן עקב אופי המשחק.

בנוסף למסנני הבטיחות הניתנים להתאמה, ל-API של Gemini יש הגנות מובנות מפני נזקים מרכזיים, כגון תוכן המסכן את בטיחות הילדים. סוגי נזק אלה תמיד חסומים ולא ניתן לתקן אותם.

רמת הסינון של בטיחות התוכן

‫Gemini API מסווג את רמת ההסתברות לכך שהתוכן לא בטוח כ-HIGH, MEDIUM, LOW או NEGLIGIBLE.

‫Gemini API חוסם תוכן על סמך הסבירות שהתוכן לא בטוח, ולא על סמך חומרת התוכן. חשוב לקחת את זה בחשבון כי יש תכנים שהסיכוי שהם לא בטוחים הוא נמוך, אבל חומרת הנזק שעלולה להיגרם מהם עדיין גבוהה. לדוגמה, בהשוואה בין המשפטים:

  1. הרובוט נתן לי אגרוף.
  2. הרובוט חתך אותי.

המשפט הראשון עשוי להוביל לסבירות גבוהה יותר של תוצאה לא בטוחה, אבל יכול להיות שהמשפט השני ייחשב לחמור יותר מבחינת אלימות. לכן חשוב לבדוק בקפידה ולשקול מה רמת החסימה המתאימה שנדרשת כדי לתמוך בתרחישי השימוש העיקריים שלכם, תוך צמצום הפגיעה במשתמשי הקצה.

סינון בטיחות לכל בקשה

אתם יכולים לשנות את הגדרות הבטיחות לכל בקשה שאתם שולחים ל-API. כששולחים בקשה, התוכן נותח ומוקצה לו סיווג בטיחות. דירוג הבטיחות כולל את הקטגוריה ואת הסיווג של הסבירות לפגיעה. לדוגמה, אם התוכן נחסם כי הסבירות שהוא משתייך לקטגוריית ההטרדה גבוהה, דירוג הבטיחות שיוחזר יכלול את הקטגוריה HARASSMENT ואת הסבירות לפגיעה HIGH.

בגלל הבטיחות המובנית של המודל, מסננים נוספים מושבתים כברירת מחדל. אם תבחרו להפעיל אותן, תוכלו להגדיר את המערכת לחסימת תוכן על סמך הסבירות שהוא לא בטוח. התנהגות המודל שמוגדרת כברירת מחדל מתאימה לרוב תרחישי השימוש, ולכן כדאי לשנות את ההגדרות האלה רק אם נדרשת עקביות באפליקציה שלכם.

בטבלה הבאה מתוארות הגדרות החסימה שאפשר לשנות בכל קטגוריה. לדוגמה, אם הגדרתם את הגדרת החסימה לחסימה של מעט בקטגוריה דברי שטנה, כל מה שיש לו סיכוי גבוה להיות תוכן של דברי שטנה ייחסם. אבל מותר להשתמש בכל ערך עם הסתברות נמוכה יותר.

סף (Google AI Studio) סף (API) תיאור
מושבת OFF השבתת מסנן הבטיחות
לא לחסום אף אחד BLOCK_NONE הצגה תמיד, ללא קשר להסתברות של תוכן לא בטוח
חסימה של כמה אנשים BLOCK_ONLY_HIGH חסימה כשיש סבירות גבוהה לתוכן לא בטוח
חסימת חלק מהמשתמשים BLOCK_MEDIUM_AND_ABOVE חסימה כשיש הסתברות בינונית או גבוהה לתוכן לא בטוח
חסימה של רוב האנשים BLOCK_LOW_AND_ABOVE חסימה כשההסתברות לתוכן לא בטוח נמוכה, בינונית או גבוהה
לא רלוונטי HARM_BLOCK_THRESHOLD_UNSPECIFIED הסף לא צוין, חסימה באמצעות סף ברירת המחדל

אם לא מגדירים את הסף, סף החסימה שמוגדר כברירת מחדל הוא מושבת למודלים של Gemini 2.5 ו-3.

אפשר להגדיר את ההגדרות האלה לכל בקשה ששולחים לשירות הגנרטיבי. פרטים נוספים זמינים במאמר בנושא HarmBlockThreshold API Reference.

משוב בנושא בטיחות

generateContent מחזירה את ‫GenerateContentResponse שכוללת משוב בנושא בטיחות.

המשוב על ההנחיות כלול ב-promptFeedback. אם הערך של promptFeedback.blockReason מוגדר, סימן שהתוכן של ההנחיה נחסם.

המשוב על המועמדים לתשובה נכלל בCandidate.finishReason ובCandidate.safetyRatings. אם תוכן התגובה נחסם והערך של finishReason היה SAFETY, אפשר לבדוק את safetyRatings כדי לקבל פרטים נוספים. התוכן שנחסם לא יוחזר.

שינוי הגדרות הבטיחות

בקטע הזה מוסבר איך לשנות את הגדרות הבטיחות ב-Google AI Studio ובקוד.

Google AI Studio

אתם יכולים לשנות את הגדרות הבטיחות ב-Google AI Studio.

לוחצים על הגדרות בטיחות בקטע הגדרות מתקדמות בחלונית הגדרות ההרצה כדי לפתוח את תיבת הדו-שיח הגדרות הבטיחות של ההרצה. בחלון הקופץ, אפשר להשתמש בפסי ההזזה כדי לשנות את רמת סינון התוכן לפי קטגוריית בטיחות:

כששולחים בקשה (לדוגמה, על ידי שאילת שאלה למודל), מופיעה הודעת תוכן חסום אם תוכן הבקשה חסום. כדי לראות פרטים נוספים, החזק את המצביע מעל הטקסט תוכן חסום כדי לראות את הקטגוריה ואת סיווג ההסתברות לנזק.

דוגמאות קוד

קטע הקוד הבא מראה כיצד להגדיר הגדרות בטיחות בשיחת GenerateContent שלך. זה קובע את הסף לקטגוריית דברי שטנה (HARM_CATEGORY_HATE_SPEECH). הגדרת קטגוריה זו ל-BLOCK_LOW_AND_ABOVE חוסמת כל תוכן שיש לו סבירות נמוכה או גבוהה יותר להיות דברי שטנה. כדי להבין את הגדרות הסף, ראו סינון בטיחות לפי בקשה.

Python

from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Some potentially unsafe prompt",
    config=types.GenerateContentConfig(
      safety_settings=[
        types.SafetySetting(
            category=types.HarmCategory.HARM_CATEGORY_HATE_SPEECH,
            threshold=types.HarmBlockThreshold.BLOCK_LOW_AND_ABOVE,
        ),
      ]
    )
)

print(response.text)

Go

package main

import (
    "context"
    "fmt"
    "log"
    "google.golang.org/genai"
)

func main() {
    ctx := context.Background()
    client, err := genai.NewClient(ctx, nil)
    if err != nil {
        log.Fatal(err)
    }

    config := &genai.GenerateContentConfig{
        SafetySettings: []*genai.SafetySetting{
            {
                Category:  "HARM_CATEGORY_HATE_SPEECH",
                Threshold: "BLOCK_LOW_AND_ABOVE",
            },
        },
    }

    response, err := client.Models.GenerateContent(
        ctx,
        "gemini-3.8-flash",
        genai.Text("Some potentially unsafe prompt."),
        config,
    )
    if err != nil {
        log.Fatal(err)
    }
    fmt.Println(response.Text())
}

JavaScript

import { GoogleGenAI } from "@google/genai";

const ai = new GoogleGenAI({});

const safetySettings = [
  {
    category: "HARM_CATEGORY_HATE_SPEECH",
    threshold: "BLOCK_LOW_AND_ABOVE",
  },
];

async function main() {
  const response = await ai.models.generateContent({
    model: "gemini-3.8-flash",
    contents: "Some potentially unsafe prompt.",
    config: {
      safetySettings: safetySettings,
    },
  });
  console.log(response.text);
}

await main();

Java

SafetySetting hateSpeechSafety = new SafetySetting(HarmCategory.HATE_SPEECH,
    BlockThreshold.LOW_AND_ABOVE);

GenerativeModel gm = new GenerativeModel(
    "gemini-3.8-flash",
    BuildConfig.apiKey,
    null, // generation config is optional
    Arrays.asList(hateSpeechSafety)
);

GenerativeModelFutures model = GenerativeModelFutures.from(gm);

REST

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "safetySettings": [
        {"category": "HARM_CATEGORY_HATE_SPEECH", "threshold": "BLOCK_LOW_AND_ABOVE"}
    ],
    "contents": [{
        "parts":[{
            "text": "'\''Some potentially unsafe prompt.'\''"
        }]
    }]
}'

השלבים הבאים

  • עיין בהפניה ל-API כדי ללמוד עוד על ה-API המלא.
  • עיין בהנחיות הבטיחות לקבלת מבט כללי על שיקולי בטיחות בעת פיתוח עם תואר שני במשפטים.
  • למידע נוסף על הערכת הסתברות לעומת חומרה מצוות Jigsaw
  • למידע נוסף על המוצרים התורמים לפתרונות בטיחות כמו Perspective API. * ניתן להשתמש בהגדרות בטיחות אלה כדי ליצור מסווג רעילות. ראה את דוגמת הסיווג כדי להתחיל.