Gemini 2.5 Flash Imageతో ఎలా నిర్మించాలి (నానో బనానా)
మీరు కొత్త Gemini 2.5 Flash Image గురించి విన్నట్లయితే (తరచుగా “నానో బనానా” అనే విచిత్రమైన కోడ్నేమ్ క్రింద కనిపిస్తుంది), దానితో ఎలా నిర్మించాలో మీరు బహుశా ఆలోచిస్తూ ఉండవచ్చు—త్వరగా. ఈ గైడ్ సెటప్, ప్రాంప్ట్లు మరియు ఉత్పత్తి నమూనాల ద్వారా మీకు మార్గనిర్దేశం చేస్తుంది, తద్వారా మీరు ఇమేజ్+టెక్స్ట్ ఫీచర్లను త్వరగా మరియు విశ్వసనీయంగా రవాణా చేయవచ్చు.
మీకు ఏమి లభిస్తుంది: ప్రాంప్ట్ రెసిపీలు, మూల్యాంకన చిట్కాలు మరియు ఉత్పత్తిని కఠినతరం చేయడంతో సహా Gemini 2.5 Flash Image మోడల్ను ఉపయోగించడం కోసం ఒక ఆచరణాత్మక, ఎండ్-టు-ఎండ్ వర్క్ఫ్లో.
Gemini 2.5 Flash Image అంటే ఏమిటి?
Gemini 2.5 Flash Image అనేది తక్కువ లేటెన్సీతో ఇమేజ్ అవగాహన మరియు జనరేషన్ టాస్క్ల కోసం ట్యూన్ చేయబడిన తేలికైన, వేగవంతమైన మల్టీమోడల్ మోడల్. ఆచరణలో, ఇది దీనికి అనువైనది:
- ఇమేజ్ అవగాహన: వర్గీకరించండి, శీర్షిక, OCR-లైట్, లేఅవుట్ వెలికితీత
- విజువల్ Q&A: ఒక చిత్రంలో ఆధారితమైన ప్రశ్నలకు సమాధానం ఇవ్వండి
- తేలికపాటి ఇమేజ్ జనరేషన్ లేదా ఎడిటింగ్: సాధారణ వైవిధ్యాలు, ఉల్లేఖనాలు, ఓవర్లేలు
- ఎడ్జ్-ఫ్రెండ్లీ అనుభవాలు: వేగవంతమైన ప్రివ్యూలు, తక్కువ-ధర అనుమితి, ఇంటరాక్టివ్ UX
“Flash” అనే పేరు సాధారణంగా ఆప్టిమైజ్ చేసిన వేగం మరియు ఖర్చును సూచిస్తుంది. “నానో బనానా” అనే మారుపేరు సాధారణంగా ఉదాహరణలు లేదా విడుదల నోట్స్లో ఉపయోగించే అంతర్గత ట్యాగ్ లేదా చెక్పాయింట్ వేరియంట్ను సూచిస్తుంది.
ముందస్తు అవసరాలు
- Gemini 2.5 Flash Imageకి యాక్సెస్తో Google AI Studio లేదా Vertex AI ఖాతా
- API కీ లేదా సర్వీస్ ఖాతా ఆధారాలు
- రన్టైమ్: Node.js, Python లేదా సర్వర్లెస్ ప్లాట్ఫారమ్ (క్లౌడ్ ఫంక్షన్స్/రన్)
- ఉత్పత్తి కోసం: లాగింగ్, రేట్ లిమిటింగ్, ప్రాంప్ట్ వెర్షనింగ్ మరియు మూల్యాంకన హార్నెస్
త్వరిత ప్రారంభం: ఇమేజ్ అవగాహన
దిగువన ఇమేజ్ Q&A మరియు శీర్షిక కోసం కనిష్ట Python ఉదాహరణ ఉంది. మీ ఆధారాలతో ప్లేస్హోల్డర్లను భర్తీ చేయండి.
import base64
import requests
API_KEY = "{YOUR_API_KEY}"
MODEL = "gemini-2.5-flash-image" # లేదా ప్రొవైడర్ యొక్క ఖచ్చితమైన మోడల్ పేరు
ENDPOINT = "(MODEL)
# ఒక ఇమేజ్ను base64లోకి లోడ్ చేయండి
with open("./sample.jpg", "rb") as f:
image_b64 = base64.b64encode(f.read).decode("utf-8")
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "ఈ చిత్రాన్ని ఒక వాక్యంలో వివరించండి, ఆపై మూడు ముఖ్య వివరాలను జాబితా చేయండి."},
{
"inline_data": {
"mime_type": "image/jpeg",
"data": image_b64
}
}
]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 300
}
}
resp = requests.post(f"{ENDPOINT}?key={API_KEY}", json=payload)
resp.raise_for_status
print(resp.json["candidates"][0]["content"]["parts"][0]["text"])
ఖచ్చితమైన సమాధానాల కోసం ప్రాంప్ట్ రెసిపీ
- సిస్టమ్ ఉద్దేశం: “మీరు ఒక ఖచ్చితమైన విజువల్ విశ్లేషకులు. ఖచ్చితంగా తెలియకపోతే, మీకు ఖచ్చితంగా తెలియదని చెప్పండి.”
- వినియోగదారు ప్రాంప్ట్: “సంక్షిప్తంగా సమాధానం చెప్పండి. కనిపించే సూచనలను పేర్కొనండి. చిత్రంలో టెక్స్ట్ ఉంటే, ఖచ్చితంగా లిప్యంతరీకరించండి.”
- నిర్మాణం కోసం అడగండి: “
శీర్షిక, objects[], text_blocks[]తో JSONను తిరిగి ఇవ్వండి.”
{
"caption": "<ఒక-వాక్య సారాంశం>",
"objects": [
{"label": "బనానా", "count": 2},
{"label": "గిన్నె", "count": 1}
],
"text_blocks": [
{"text": "నానో బనానా", "bbox": [x,y,w,h]}
]
}
త్వరిత ప్రారంభం: తేలికపాటి జనరేషన్/ఎడిటింగ్
సాధారణ ఓవర్లేలు లేదా వైవిధ్యాల కోసం, చాలా మంది ప్రొవైడర్లు ఇమేజ్-టు-ఇమేజ్ ఎండ్పాయింట్ను బహిర్గతం చేస్తారు. సూడోకోడ్:
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "పై-కుడి మూలలో సూక్ష్మమైన లేబుల్ 'నమూనా'ను జోడించండి."},
{"inline_data": {"mime_type": "image/png", "data": image_b64}}
]
}],
"generationConfig": {"temperature": 0.3, "maxOutputTokens": 0},
"tools": [{"imageEdit": {"strength": 0.25}}]
}
- కనిష్ట ఎడిట్ల కోసం
strengthను తక్కువగా ఉంచండి.
- ప్లేస్మెంట్ మరియు శైలిని ఎల్లప్పుడూ పేర్కొనండి: “పై-కుడి, 12px, సెమీ-ట్రాన్స్పరెంట్ వైట్.”
- సమ్మతి కోసం, వాటర్మార్క్ చేసిన లేదా కాపీరైట్ చేయబడిన చిత్రాలను పునఃసృష్టించమని ఎప్పుడూ అడగవద్దు.
విశ్వసనీయ పైప్లైన్ను నిర్మించడం
1) టాస్క్లు మరియు అంగీకార ప్రమాణాలను నిర్వచించండి
- ఇమేజ్ శీర్షిక: కనిపించే టెక్స్ట్పై WER < 10%, శీర్షిక <= 20 పదాలు
- విజువల్ Q&A: ముఖ్య వాస్తవాలపై ఖచ్చితమైన-సరిపోలిక; “ఖచ్చితంగా తెలియదు” ఫాల్బ్యాక్ను అనుమతించండి
- లేఅవుట్ వెలికితీత: ధర, తేదీ, SKU వంటి ఎంటిటీలపై ఖచ్చితత్వం/గుర్తుచేసుకోవడం
2) ప్రాంప్ట్లను రూపొందించండి
- అవుట్పుట్ ఫార్మాట్: ఫీల్డ్ రకాలతో JSON స్కీమా
- రక్షణలు: “టెక్స్ట్ కనిపించకపోతే,
nullని తిరిగి ఇవ్వండి”
3) బ్యాచ్ మరియు కాష్
- వీలైనప్పుడల్లా బ్యాచ్ ఇమేజ్ అభ్యర్థనలు
- స్థిరమైన ఫలితాలను కాష్ చేయండి (ఉదా., మారని ఉత్పత్తి ఫోటోలు)
- డిడూప్ చేయడానికి ETags లేదా కంటెంట్ హాష్లను ఉపయోగించండి
4) క్రమపద్ధతిలో మూల్యాంకనం చేయండి
- ఒక చిన్న బంగారు సెట్ను నిర్మించండి: గ్రౌండ్-ట్రూత్ లేబుల్లతో 100–500 చిత్రాలు
- మెట్రిక్లను ట్రాక్ చేయండి: ఖచ్చితత్వం, భ్రమ రేటు, ప్రతిస్పందన లేటెన్సీ
- ప్రతి ప్రాంప్ట్ వెర్షన్కు ఒక రిగ్రెషన్ సూట్ను సృష్టించండి
5) ఉత్పత్తి నియంత్రణలు
- నిర్దిష్ట అవుట్పుట్ల కోసం
maxOutputTokensను గట్టిగా సెట్ చేయండి
- వాస్తవిక టాస్క్ల కోసం తక్కువ
temperature (0.1–0.4)ని ఉపయోగించండి
- వినియోగదారు మరియు సంస్థ ద్వారా రేట్-పరిమితి; ఘాతాంక బ్యాక్ఆఫ్ను జోడించండి
- ఇన్పుట్లు/అవుట్పుట్లను లాగ్ చేయండి (గోప్యత కోసం ముడి కాదు, ఇమేజ్ను హాష్ చేయండి)
సాధారణ వినియోగ సందర్భాలు మరియు నమూనాలు
విజువల్ ఉత్పత్తి శోధన
- కేటలాగ్ చిత్రాలను తీసుకోండి,
objects, dominant_color, styleను వెలికితీయండి
- ప్రశ్న సమయంలో, ఎంబెడింగ్లు లేదా లక్షణాలను సరిపోల్చండి
- ప్రాంప్ట్ నమూనా: “షాపింగ్ చేసే వ్యక్తి నిర్ణయించడానికి సహాయపడే టాప్ 5 లక్షణాలను తిరిగి ఇవ్వండి.”
డాక్యుమెంట్ లైట్ OCR
- చిన్న, స్పష్టమైన టెక్స్ట్ బ్లాక్లను లిప్యంతరీకరించమని మోడల్ను అడగండి
- పరిమితులను జోడించండి: “ఖచ్చితమైన కేసు మరియు విరామ చిహ్నాలను తిరిగి ఇవ్వండి; చదవడానికి వీలుకాకపోతే,
confidence: lowను సెట్ చేయండి.”
స్క్రీన్షాట్ల కోసం UX కోపైలట్
- ఇన్పుట్: యాప్ స్క్రీన్షాట్
- అవుట్పుట్: బుల్లెట్ పాయింట్లుగా దశలు: “నేను టెక్స్ట్ను ఎలా కేంద్రీకరించాలి?” → మోడల్ మెనూ మార్గాన్ని తిరిగి ఇస్తుంది
ధర మరియు లేటెన్సీ చిట్కాలు
- ప్రివ్యూలు మరియు ఇటరేటివ్ UX కోసం “Flash”ని ఇష్టపడండి; తుది తనిఖీల కోసం పెద్ద Gemini వేరియంట్లకు పెంచండి
- ముఖ్య వివరాలను కోల్పోకుండా బ్యాండ్విడ్త్ను తగ్గించడానికి గరిష్ట అంచుకు (ఉదా., 1024px) డౌన్స్కేల్ చేయండి
- టాస్క్లను చైన్ చేస్తున్నప్పుడు ఎంబెడింగ్లు లేదా ఇంటర్మీడియట్ సారాంశాలను తిరిగి ఉపయోగించండి
భద్రత, గోప్యత మరియు భద్రత
- లాగింగ్ చేయడానికి ముందు PIIని సవరించండి; ఇమేజ్ IDల కోసం కంటెంట్ హాషింగ్ను ఉపయోగించండి
- పరిమాణం/రకం అనుమతి జాబితాలను అమలు చేయండి: jpeg, png; svg/exeని తిరస్కరించండి
- ప్రాంప్ట్ రక్షణలను జోడించండి: “ప్రైవేట్ వ్యక్తులను గుర్తించమని అడిగితే తిరస్కరించండి”
ఉదాహరణ: ఎండ్-టు-ఎండ్ శీర్షిక మైక్రోసర్వీస్
from fastapi import FastAPI, UploadFile, File
import base64, requests, os
app = FastAPI
API_KEY = os.getenv("API_KEY")
MODEL = "gemini-2.5-flash-image"
ENDPOINT = f"("/caption")
async def caption(file: UploadFile = File:
b = await file.read
b64 = base64.b64encode(b).decode("utf-8")
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "ఫీల్డ్లతో సంక్షిప్త JSONను తిరిగి ఇవ్వండి: శీర్షిక, objects[]."},
{"inline_data": {"mime_type": file.content_type, "data": b64}}
]
}],
"generationConfig": {"temperature": 0.2, "maxOutputTokens": 200}
}
r = requests.post(f"{ENDPOINT}?key={API_KEY}", json=payload, timeout=30)
r.raise_for_status
return r.json
సమస్య పరిష్కారం
- అస్పష్టమైన అవుట్పుట్లు లేదా తప్పిపోయిన టెక్స్ట్: తక్కువ డౌన్స్కేల్ చేయండి; అధిక-రిజల్యూషన్ ఇన్పుట్ను అభ్యర్థించండి; OCRని స్పష్టంగా అడగండి
- స్థిరంగా లేని JSON:
strict_json పోస్ట్-ప్రాసెసర్ను జోడించండి లేదా కంచె వేసిన JSON ```json బ్లాక్ల కోసం అడగండి
- భ్రమ కలిగించే వివరాలు: ఉష్ణోగ్రతను తగ్గించండి; “ఖచ్చితంగా తెలియకపోతే,
ఖచ్చితంగా తెలియదని ప్రతిస్పందించండి” అని సూచించండి
- సమయం ముగిసింది: అందుబాటులో ఉంటే ప్రతిస్పందనలను ప్రసారం చేయండి; ఇమేజ్ పరిమాణాన్ని తగ్గించండి; చిన్న ప్రాంప్ట్లను సెట్ చేయండి
మార్గం ద్వారా: Sider.AIతో నమూనాను వేగవంతం చేయండి
మీరు చాలా ప్రాంప్ట్ వేరియంట్లను నిర్మిస్తుంటే లేదా Gemini 2.5 Flash Image కోసం శీఘ్ర A/B పరీక్షలు అవసరమైతే, Sider.AI మీరు వేగంగా పునరావృతం చేయడానికి సహాయపడుతుంది. మీరు ప్రాంప్ట్ వెర్షన్లను నిర్వహించవచ్చు, మీ ఇమేజ్ సెట్లో పక్కపక్కనే మూల్యాంకనాలను అమలు చేయవచ్చు మరియు పూర్తి బ్యాకెండ్ను వైరింగ్ చేయకుండా లేటెన్సీ మరియు ఖచ్చితత్వ మెట్రిక్లను సంగ్రహించవచ్చు—మీరు శీర్షిక, OCR లేదా విజువల్ Q&A కోసం ప్రాంప్ట్లను ట్యూన్ చేస్తున్నప్పుడు ఉపయోగపడుతుంది.
ముఖ్యమైన విషయాలు
- వేగవంతమైన, తక్కువ-ధర మల్టీమోడల్ టాస్క్ల కోసం Gemini 2.5 Flash Image చాలా గొప్పది
- విశ్వసనీయత కోసం ఖచ్చితమైన ప్రాంప్ట్లు, JSON స్కీమాలు మరియు తక్కువ ఉష్ణోగ్రతలను ఉపయోగించండి
- పునరావృత మూల్యాంకన సెట్ను నిర్మించండి మరియు రిగ్రెషన్ పరీక్షలతో మార్పులను గేట్ చేయండి
- డౌన్స్కేలింగ్, కాషింగ్ మరియు బ్యాచింగ్తో లేటెన్సీని ఆప్టిమైజ్ చేయండి
- వేగవంతమైన ప్రాంప్ట్ పునరుక్తి మరియు ప్రయోగం కోసం Sider.AIని పరిగణించండి
FAQ
Q1:Gemini 2.5 Flash Image (నానో బనానా) అంటే ఏమిటి?
ఇది ఇమేజ్ అవగాహన మరియు సాధారణ ఇమేజ్ ఎడిట్ల కోసం ఆప్టిమైజ్ చేయబడిన వేగవంతమైన, తేలికపాటి మల్టీమోడల్ మోడల్. “నానో బనానా” అనే మారుపేరు తరచుగా అంతర్గత ట్యాగ్ లేదా ఉదాహరణ వేరియంట్ను సూచిస్తుంది.
Q2:ఇమేజ్ శీర్షిక కోసం నేను Gemini 2.5 Flash Imageని ఎలా ఉపయోగించగలను?
మోడల్ యొక్క generateContent ఎండ్పాయింట్కు టెక్స్ట్ సూచనతో పాటు ఇమేజ్ను base64గా పంపండి. నిర్మాణాత్మక JSON (శీర్షిక, objects, text_blocks) కోసం అడగండి మరియు స్థిరత్వం కోసం ఉష్ణోగ్రతను తక్కువగా ఉంచండి.
Q3:Gemini 2.5 Flash Image OCR లేదా చిత్రాలలో టెక్స్ట్ను నిర్వహించగలదా?
అవును, చిన్న మరియు స్పష్టమైన టెక్స్ట్ కోసం. ఖచ్చితమైన లిప్యంతరీకరణ అవసరాలను పేర్కొనండి మరియు విశ్వాస ఫీల్డ్ను చేర్చండి. భారీ-డ్యూటీ OCR కోసం, మోడల్తో పాటు ప్రత్యేక OCR సాధనాన్ని పరిగణించండి.
Q4:Gemini 2.5 Flash Imageతో లేటెన్సీ మరియు ఖర్చును నేను ఎలా తగ్గించగలను?
సహేతుకమైన గరిష్ట అంచుకు చిత్రాలను డౌన్స్కేల్ చేయండి, అభ్యర్థనలను బ్యాచ్ చేయండి మరియు స్థిరమైన ఫలితాలను కాష్ చేయండి. తక్కువ ఉష్ణోగ్రతలను ఉపయోగించండి మరియు అవుట్పుట్ పరిమాణాన్ని నియంత్రించడానికి maxOutputTokensని పరిమితం చేయండి.
Q5:Gemini 2.5 Flash Imageతో నిర్మిస్తున్నప్పుడు Sider.AI ఎలా సహాయపడుతుంది?
Sider.AI ప్రాంప్ట్ వెర్షనింగ్ మరియు మూల్యాంకనాన్ని క్రమబద్ధీకరిస్తుంది, కాబట్టి మీరు మీ ఇమేజ్ డేటాసెట్లో ప్రాంప్ట్లను A/B పరీక్షించవచ్చు, మెట్రిక్లను ట్రాక్ చేయవచ్చు మరియు విశ్వసనీయ కాన్ఫిగరేషన్లను ఉత్పత్తికి వేగంగా ప్రమోట్ చేయవచ్చు.