Kaip kurti naudojant „Gemini 2.5 Flash Image“ („nano banana“)
Jei girdėjote apie naująjį „Gemini 2.5 Flash Image“ (dažnai pasirodantį su keistu kodiniu pavadinimu „nano banana“), tikriausiai jums įdomu, kaip iš tikrųjų su juo kurti – greitai. Šis vadovas padės jums atlikti sąranką, raginimus ir gamybos modelius, kad galėtumėte greitai ir patikimai pateikti vaizdo ir teksto funkcijas.
Ką gausite: praktišką, visapusišką darbo eigą, skirtą naudoti „Gemini 2.5 Flash Image“ modeliui, įskaitant raginimų receptus, vertinimo patarimus ir gamybos stiprinimą.
Kas yra „Gemini 2.5 Flash Image“?
„Gemini 2.5 Flash Image“ yra lengvas, greitas multimodinis modelis, pritaikytas vaizdų supratimo ir generavimo užduotims su mažu latentiniu laiku. Praktiškai jis idealiai tinka:
- Vaizdo supratimas: klasifikuoti, antraštės, OCR-lite, išdėstymo ištraukimas
- Vaizdiniai klausimai ir atsakymai: atsakyti į klausimus, pagrįstus vaizdu
- Lengvas vaizdų generavimas arba redagavimas: paprastos variacijos, anotacijos, perdangos
- Patirtis, pritaikyta kraštams: greitos peržiūros, nebrangi išvada, interaktyvi UX
„Flash“ pavadinimas paprastai reiškia optimizuotą greitį ir kainą. Slapyvardis „nano banana“ paprastai reiškia vidinę žymą arba kontrolinio taško variantą, naudojamą pavyzdžiuose arba leidimo pastabose.
Būtinos sąlygos
- „Google AI Studio“ arba „Vertex AI“ paskyra su prieiga prie „Gemini 2.5 Flash Image“
- API raktas arba paslaugų paskyros kredencialai
- Paleidimo aplinka: Node.js, Python arba serverless platforma („Cloud Functions“/„Run“)
- Gamybai: registravimas, greičio apribojimas, raginimų versijų valdymas ir vertinimo priemonė
Greitas startas: vaizdo supratimas
Žemiau pateiktas minimalus Python pavyzdys vaizdo klausimams ir atsakymams bei antraštėms. Pakeiskite vietos rezervavimo ženklus savo kredencialais.
import base64
import requests
API_KEY = "{YOUR_API_KEY}"
MODEL = "gemini-2.5-flash-image" # arba tikslus teikėjo modelio pavadinimas
ENDPOINT = "{MODEL}"
# Įkelkite vaizdą į base64
with open("./sample.jpg", "rb") as f:
image_b64 = base64.b64encode(f.read).decode("utf-8")
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "Apibūdinkite šį vaizdą vienu sakiniu, tada išvardykite tris pagrindines detales."},
{
"inline_data": {
"mime_type": "image/jpeg",
"data": image_b64
}
}
]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 300
}
}
resp = requests.post(f"{ENDPOINT}?key={API_KEY}", json=payload)
resp.raise_for_status
print(resp.json["candidates"][0]["content"]["parts"][0]["text"])
Ragimo receptas patikimiems atsakymams
- Sistemos ketinimas: „Jūs esate tikslus vaizdo analizatorius. Jei nesate tikri, pasakykite, kad nesate tikri.“
- Vartotojo raginimas: „Atsakykite glaustai. Citata matomus ženklus. Jei vaizde yra teksto, transkribuokite tiksliai.“
- Paprašykite struktūros: „Grąžinkite JSON su
caption, objects[], text_blocks[].“
{
"caption": "<vieno sakinio santrauka>",
"objects": [
{"label": "bananas", "count": 2},
{"label": "dubuo", "count": 1}
],
"text_blocks": [
{"text": "NANO BANANA", "bbox": [x,y,w,h]}
]
}
Greitas startas: lengvas generavimas/redagavimas
Paprastoms perdangoms ar variacijoms daugelis teikėjų pateikia vaizdo į vaizdą galinį punktą. Pseudokodas:
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "Pridėkite subtilią etiketę „Sample“ viršutiniame dešiniajame kampe."},
{"inline_data": {"mime_type": "image/png", "data": image_b64}}
]
}],
"generationConfig": {"temperature": 0.3, "maxOutputTokens": 0},
"tools": [{"imageEdit": {"strength": 0.25}}]
}
- Laikykite
strength žemą, kad redagavimai būtų minimalūs.
- Visada nurodykite vietą ir stilių: „viršutinis dešinysis, 12 pikselių, pusiau skaidrus baltas.“
- Kad atitiktų reikalavimus, niekada neprašykite atkurti vandens ženklais pažymėtų ar autorių teisėmis saugomų vaizdų.
Patikimo vamzdyno kūrimas
1) Apibrėžkite užduotis ir priėmimo kriterijus
- Vaizdo antraštės: WER matomame tekste < 10%, antraštė <= 20 žodžių
- Vaizdiniai klausimai ir atsakymai: tikslus atitikimas pagal pagrindinius faktus; leisti „nesu tikras“ atsarginį variantą
- Išdėstymo ištraukimas: tikslumas/atkūrimas pagal tokius objektus kaip kaina, data, SKU
2) Struktūruokite raginimus
- Instrukcija pirmiausia, tada vaizdas
- Išvesties formatas: JSON schema su laukų tipais
- Apsaugos priemonės: „Jei tekstas nematomas, grąžinkite
null“
3) Paketinis apdorojimas ir talpykla
- Jei įmanoma, apdorokite vaizdo užklausas paketais
- Talpykloje laikykite stabilius rezultatus (pvz., nesikeičiančias produktų nuotraukas)
- Naudokite ETag arba turinio maišos, kad pašalintumėte dubliavimą
4) Sistemingai vertinkite
- Sukurkite nedidelį auksinį rinkinį: 100–500 vaizdų su pagrindinėmis etiketėmis
- Stebėkite metrikas: tikslumas, haliucinacijų dažnis, atsako latentinis laikas
- Sukurkite regresijos rinkinį kiekvienai raginimo versijai
5) Gamybos valdikliai
- Nustatykite
maxOutputTokens griežtai, kad išvestys būtų deterministinės
- Naudokite žemesnę
temperature (0,1–0,4) faktinėms užduotims
- Apribokite greitį pagal vartotoją ir organizaciją; pridėkite eksponentinį atsitraukimą
- Registruokite įvestis/išvestis (maišos vaizdą, neapdorotą privatumui)
Dažni naudojimo atvejai ir modeliai
Vaizdinė produktų paieška
- Įkelkite katalogo vaizdus, ištraukite
objects, dominant_color, style
- Užklausos metu palyginkite įterpimus arba atributus
- Ragimo modelis: „Grąžinkite 5 geriausius atributus, kurie padėtų pirkėjui apsispręsti.“
Dokumento Lite OCR
- Paprašykite modelio transkribuoti trumpus, aiškius teksto blokus
- Pridėkite apribojimus: „Grąžinkite tikslų atvejį ir skyrybą; jei neįskaitoma, nustatykite
confidence: low.“
UX Copilot ekrano nuotraukoms
- Įvestis: programos ekrano nuotrauka
- Išvestis: veiksmai kaip punktai: „Kaip centruoti tekstą?“ → modelis grąžina meniu kelią
Patarimai dėl kainos ir latentinio laiko
- Pirmenybę teikite „Flash“ peržiūroms ir iteracinei UX; pereikite prie didesnių „Gemini“ variantų galutiniams patikrinimams
- Sumažinkite iki maksimalaus krašto (pvz., 1024 pikselių), kad sumažintumėte pralaidumą neprarandant pagrindinių detalių
- Pakartotinai naudokite įterpimus arba tarpines santraukas, kai sujungiamos užduotys
Saugumas, privatumas ir sauga
- Redaguokite PII prieš registruodami; naudokite turinio maišos vaizdo ID
- Įgyvendinkite dydžio/tipo leidimų sąrašus: jpeg, png; atmesti svg/exe
- Pridėkite raginimo apsaugos priemones: „Atsisakykite, jei prašoma identifikuoti privačius asmenis“
Pavyzdys: visapusiškas antraščių mikroservisas
from fastapi import FastAPI, UploadFile, File
import base64, requests, os
app = FastAPI
API_KEY = os.getenv("API_KEY")
MODEL = "gemini-2.5-flash-image"
ENDPOINT = f"("/caption")
async def caption(file: UploadFile = File:
b = await file.read
b64 = base64.b64encode(b).decode("utf-8")
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "Grąžinkite glaustą JSON su laukais: caption, objects[]."},
{"inline_data": {"mime_type": file.content_type, "data": b64}}
]
}],
"generationConfig": {"temperature": 0.2, "maxOutputTokens": 200}
}
r = requests.post(f"{ENDPOINT}?key={API_KEY}", json=payload, timeout=30)
r.raise_for_status
return r.json
Trikčių šalinimas
- Neryškios išvestys arba praleistas tekstas: sumažinkite mažiau; paprašykite didesnės raiškos įvesties; aiškiai paprašykite OCR
- Nenuoseklus JSON: pridėkite
strict_json apdorojimo priemonę arba paprašykite aptvertų JSON ```json blokų
- Haliucinacijos detalės: sumažinkite temperatūrą; nurodykite „Jei nesate tikri, atsakykite
nesu tikras“
- Laiko apribojimai: transliuokite atsakymus, jei įmanoma; sumažinkite vaizdo dydį; nustatykite trumpesnius raginimus
Beje: pagreitinkite prototipų kūrimą su Sider.AI
Jei kuriate daug raginimo variantų arba jums reikia greitų A/B testų „Gemini 2.5 Flash Image“, Sider.AI gali padėti jums greičiau iteruoti. Galite tvarkyti raginimo versijas, vykdyti lygiagrečius vertinimus savo vaizdų rinkinyje ir užfiksuoti latentinio laiko ir tikslumo metrikas neįdiegę viso backend – tai patogu, kai derinate raginimus antraštėms, OCR arba vaizdiniams klausimams ir atsakymams.
Pagrindiniai dalykai
- „Gemini 2.5 Flash Image“ puikiai tinka greitoms, nebrangioms multimodinėms užduotims
- Naudokite tikslius raginimus, JSON schemas ir žemas temperatūras, kad užtikrintumėte patikimumą
- Sukurkite pakartojamą vertinimo rinkinį ir pakeiskite vartus su regresijos testais
- Optimizuokite latentinį laiką sumažindami mastelį, talpyklą ir apdorodami paketais
- Apsvarstykite Sider.AI, kad galėtumėte greitai iteruoti ir eksperimentuoti su raginimais
DUK
Q1:Kas yra „Gemini 2.5 Flash Image“ („nano banana“)?
Tai greitas, lengvas multimodinis modelis, optimizuotas vaizdų supratimui ir paprastam vaizdų redagavimui. Slapyvardis „nano banana“ dažnai reiškia vidinę žymą arba pavyzdinį variantą.
Q2:Kaip naudoti „Gemini 2.5 Flash Image“ vaizdų antraštėms?
Siųskite teksto instrukciją ir vaizdą kaip base64 į modelio generateContent galinį punktą. Paprašykite struktūruoto JSON (antraštė, objektai, text_blocks) ir laikykite žemą temperatūrą, kad būtų užtikrintas nuoseklumas.
Q3:Ar „Gemini 2.5 Flash Image“ gali apdoroti OCR arba tekstą vaizduose?
Taip, trumpam ir aiškiam tekstui. Nurodykite tikslius transkribavimo reikalavimus ir įtraukite pasitikėjimo lauką. Norėdami atlikti didelio našumo OCR, apsvarstykite galimybę naudoti specialią OCR priemonę kartu su modeliu.
Q4:Kaip sumažinti latentinį laiką ir kainą naudojant „Gemini 2.5 Flash Image“?
Sumažinkite vaizdų mastelį iki pagrįsto maksimalaus krašto, apdorokite užklausas paketais ir talpykloje laikykite stabilius rezultatus. Naudokite žemesnę temperatūrą ir apribokite maxOutputTokens, kad valdytumėte išvesties dydį.
Q5:Kaip Sider.AI gali padėti kuriant su „Gemini 2.5 Flash Image“?
Sider.AI supaprastina raginimų versijų valdymą ir vertinimą, todėl galite atlikti A/B testus su raginimais savo vaizdų duomenų rinkinyje, stebėti metrikas ir greičiau perkelti patikimas konfigūracijas į gamybą.