Gemini 2.5 Flash Image-ஐக் கொண்டு உருவாக்குவது எப்படி (nano banana)
புதிய Gemini 2.5 Flash Image-ஐப் பற்றி நீங்கள் கேள்விப்பட்டிருந்தால் ("nano banana" என்ற வினோதமான குறியீட்டுப் பெயரில் அடிக்கடி வெளிவரும்), அதை வைத்து எப்படி உருவாக்குவது என்று நீங்கள் யோசிக்கலாம் - வேகமாக. இந்த வழிகாட்டி அமைப்பு, தூண்டுதல்கள் மற்றும் உற்பத்தி முறைகள் மூலம் உங்களுக்கு வழிகாட்டும், இதன் மூலம் நீங்கள் படம்+உரை அம்சங்களை விரைவாகவும் நம்பகத்தன்மையுடனும் அனுப்பலாம்.
நீங்கள் பெறுவது: Gemini 2.5 Flash Image மாதிரியைப் பயன்படுத்துவதற்கான நடைமுறை, இறுதி முதல் இறுதி வரையிலான பணிப்பாய்வு, இதில் prompt recipes, மதிப்பீட்டு உதவிக்குறிப்புகள் மற்றும் உற்பத்தி கடினப்படுத்துதல் ஆகியவை அடங்கும்.
Gemini 2.5 Flash Image என்றால் என்ன?
Gemini 2.5 Flash Image என்பது குறைந்த தாமதத்துடன் கூடிய படத்தைப் புரிந்துகொள்ளுதல் மற்றும் உருவாக்கும் பணிகளுக்காக வடிவமைக்கப்பட்ட ஒரு எடையற்ற, வேகமான multimodal மாதிரி ஆகும். நடைமுறையில், இது இதற்கு ஏற்றது:
- படத்தைப் புரிந்துகொள்ளுதல்: வகைப்படுத்துதல், தலைப்பிடுதல், OCR-lite, தளவமைப்பு பிரித்தெடுத்தல்
- காட்சி Q&A: ஒரு படத்தில் உள்ள அடிப்படைக் கேள்விகளுக்குப் பதிலளித்தல்
- எடையற்ற பட உருவாக்கம் அல்லது எடிட்டிங்: எளிய மாறுபாடுகள், சிறுகுறிப்புகள், மேலடுக்குகள்
- Edge-friendly அனுபவங்கள்: வேகமான முன்னோட்டங்கள், குறைந்த விலை 추론ம், ஊடாடும் UX
"Flash" என்ற பெயர் பொதுவாக மேம்படுத்தப்பட்ட வேகம் மற்றும் செலவைக் குறிக்கிறது. "nano banana" என்ற புனைப்பெயர் பொதுவாக எடுத்துக்காட்டுகளில் அல்லது வெளியீட்டுக் குறிப்புகளில் பயன்படுத்தப்படும் உள் குறிச்சொல் அல்லது checkpoint மாறுபாட்டைக் குறிக்கிறது.
முன்தேவைகள்
- Gemini 2.5 Flash Image-க்கான அணுகலுடன் Google AI Studio அல்லது Vertex AI கணக்கு
- API key அல்லது சேவை கணக்கு சான்றுகள்
- Runtime: Node.js, Python, அல்லது serverless platform (Cloud Functions/Run)
- உற்பத்திக்கு: பதிவு செய்தல், rate limiting, prompt versioning மற்றும் மதிப்பீட்டு harness
விரைவான தொடக்கம்: படத்தைப் புரிந்துகொள்ளுதல்
பட Q&A மற்றும் தலைப்பிடுதலுக்கான குறைந்தபட்ச Python உதாரணம் கீழே உள்ளது. உங்கள் சான்றுகளுடன் placeholder-களை மாற்றவும்.
import base64
import requests
API_KEY = "{YOUR_API_KEY}"
MODEL = "gemini-2.5-flash-image" # அல்லது வழங்குநரின் சரியான மாதிரி பெயர்
ENDPOINT = "{MODEL}
# ஒரு படத்தை base64 ஆக ஏற்றவும்
with open("./sample.jpg", "rb") as f:
image_b64 = base64.b64encode(f.read).decode("utf-8")
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "இந்த படத்தை ஒரு வாக்கியத்தில் விவரிக்கவும், பின்னர் மூன்று முக்கிய விவரங்களை பட்டியலிடவும்."},
{
"inline_data": {
"mime_type": "image/jpeg",
"data": image_b64
}
}
]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 300
}
}
resp = requests.post(f"{ENDPOINT}?key={API_KEY}", json=payload)
resp.raise_for_status
print(resp.json["candidates"][0]["content"]["parts"][0]["text"])
வலுவான பதில்களுக்கான Prompt recipe
- System intent: “நீங்கள் ஒரு துல்லியமான காட்சி ஆய்வாளர். உறுதியாக தெரியவில்லை என்றால், உங்களுக்குத் தெரியாது என்று சொல்லுங்கள்.”
- User prompt: “சுருக்கமாக பதிலளிக்கவும். தெரியும் குறிப்புகளைக் குறிப்பிடவும். படத்தில் உரை இருந்தால், அதை அப்படியே படியெடுத்து எழுதவும்.”
- அமைப்பைக் கேளுங்கள்: “
caption, objects[], text_blocks[] உடன் JSON-ஐத் திருப்பி அனுப்புங்கள்.”
{
"caption": "<ஒரு-வாக்கிய சுருக்கம்>",
"objects": [
{"label": "banana", "count": 2},
{"label": "bowl", "count": 1}
],
"text_blocks": [
{"text": "NANO BANANA", "bbox": [x,y,w,h]}
]
}
விரைவான தொடக்கம்: எடையற்ற உருவாக்கம்/எடிட்டிங்
எளிய மேலடுக்குகள் அல்லது மாறுபாடுகளுக்கு, பல வழங்குநர்கள் image-to-image endpoint-ஐ வெளிப்படுத்துகிறார்கள். Pseudocode:
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "மேல்-வலது மூலையில் 'Sample' என்ற நுட்பமான லேபிளைச் சேர்க்கவும்."},
{"inline_data": {"mime_type": "image/png", "data": image_b64}}
]
}],
"generationConfig": {"temperature": 0.3, "maxOutputTokens": 0},
"tools": [{"imageEdit": {"strength": 0.25}}]
}
- குறைந்தபட்ச மாற்றங்களுக்கு
strength-ஐ குறைவாக வைக்கவும்.
- எப்போதும் placement மற்றும் style-ஐ குறிப்பிடவும்: “top-right, 12px, semi-transparent white.”
- ஒழுங்குமுறைக்கு, watermarked அல்லது பதிப்புரிமை பெற்ற படங்களை மீண்டும் உருவாக்கக் கேட்காதீர்கள்.
நம்பகமான Pipeline-ஐ உருவாக்குதல்
1) பணிகள் மற்றும் ஏற்றுக்கொள்ளும் அளவுகோல்களை வரையறுக்கவும்
- பட தலைப்பிடுதல்: தெரியும் உரையில் WER < 10%, தலைப்பு <= 20 வார்த்தைகள்
- காட்சி Q&A: முக்கிய உண்மைகளில் சரியான பொருத்தம்; "தெரியாது" fallback-ஐ அனுமதிக்கவும்
- தளவமைப்பு பிரித்தெடுத்தல்: விலை, தேதி, SKU போன்ற entities-களில் துல்லியம்/நினைவுகூர்தல்
2) Prompt-களை கட்டமைக்கவும்
- முதலில் அறிவுறுத்தல், பின்னர் படம்
- வெளியீட்டு வடிவம்: புல வகைளுடன் JSON schema
- பாதுகாப்பு: “உரை தெரியவில்லை என்றால்,
null-ஐத் திருப்பி அனுப்பவும்”
3) Batch மற்றும் cache
- முடிந்தவரை படக் கோரிக்கைகளை batch செய்யவும்
- நிலையான முடிவுகளை cache செய்யவும் (எ.கா., மாறாத தயாரிப்பு புகைப்படங்கள்)
- dedupe செய்ய ETags அல்லது content hashes-களைப் பயன்படுத்தவும்
4) முறையாக மதிப்பிடுங்கள்
- ஒரு சிறிய gold set-ஐ உருவாக்கவும்: ground-truth லேபிள்களுடன் 100-500 படங்கள்
- metrics-களை கண்காணிக்கவும்: துல்லியம், hallucination விகிதம், பதில் தாமதம்
- prompt பதிப்பிற்கு ஒரு regression suite-ஐ உருவாக்கவும்
5) உற்பத்தி கட்டுப்பாடுகள்
- நிர்ணயிக்கப்பட்ட வெளியீடுகளுக்கு
maxOutputTokens-ஐ இறுக்கமாக அமைக்கவும்
- உண்மையான பணிகளுக்கு குறைந்த
temperature-ஐ (0.1-0.4) பயன்படுத்தவும்
- பயனர் மற்றும் அமைப்பு மூலம் Rate-limit; exponential backoff-ஐ சேர்க்கவும்
- உள்ளீடுகள்/வெளியீடுகளை பதிவு செய்யவும் (படத்தை hash செய்யவும், தனியுரிமைக்காக raw அல்ல)
பொதுவான பயன்பாட்டு வழக்குகள் மற்றும் முறைகள்
காட்சி தயாரிப்பு தேடல்
- catalog படங்களை உட்கொள்ளவும்,
objects, dominant_color, style-ஐ பிரித்தெடுக்கவும்
- query நேரத்தில், embeddings அல்லது attributes-களை ஒப்பிடவும்
- Prompt pattern: “ஒரு கடைக்காரர் தீர்மானிக்க உதவும் முதல் 5 attributes-களைத் திருப்பி அனுப்பவும்.”
ஆவண Lite OCR
- குறுகிய, தெளிவான உரை தொகுதிகளை படியெடுத்து எழுத மாதிரியிடம் கேட்கவும்
- constraints-களைச் சேர்க்கவும்: “சரியான எழுத்து மற்றும் நிறுத்தற்குறிகளைத் திருப்பி அனுப்பவும்; படிக்க முடியாவிட்டால்,
confidence: low-ஐ அமைக்கவும்.”
ஸ்கிரீன்ஷாட்களுக்கான UX Copilot
- உள்ளீடு: பயன்பாட்டு ஸ்கிரீன்ஷாட்
- வெளியீடு: புல்லட் புள்ளிகளாக படிகள்: “உரையை எப்படி மையப்படுத்துவது?” → மாதிரி மெனு பாதையை வழங்கும்
செலவு மற்றும் தாமத உதவிக்குறிப்புகள்
- முன்னோட்டங்கள் மற்றும் iterative UX-க்கு “Flash”-ஐ விரும்புங்கள்; இறுதி சோதனைகளுக்கு பெரிய Gemini வகைகளுக்கு அதிகரிக்கவும்
- முக்கிய விவரங்களை இழக்காமல் bandwidth-ஐ குறைக்க அதிகபட்ச விளிம்பிற்கு (எ.கா., 1024px) Downscale செய்யவும்
- பணிகளை சங்கிலித்தொடராக இணைக்கும்போது embeddings அல்லது இடைநிலை சுருக்கங்களை மீண்டும் பயன்படுத்தவும்
பாதுகாப்பு, தனியுரிமை மற்றும் பாதுகாப்பு
- பதிவு செய்வதற்கு முன் PII-ஐத் திருத்தவும்; பட ID-களுக்கு content hashing-ஐப் பயன்படுத்தவும்
- அளவு/வகை allowlists-களைச் செயல்படுத்தவும்: jpeg, png; svg/exe-ஐ நிராகரிக்கவும்
- Prompt safeguards-களைச் சேர்க்கவும்: “தனிப்பட்ட நபர்களை அடையாளம் காணும்படி கேட்டால் நிராகரிக்கவும்”
உதாரணம்: இறுதி முதல் இறுதி வரையிலான தலைப்பிடுதல் Microservice
from fastapi import FastAPI, UploadFile, File
import base64, requests, os
app = FastAPI
API_KEY = os.getenv("API_KEY")
MODEL = "gemini-2.5-flash-image"
ENDPOINT = f"("/caption")
async def caption(file: UploadFile = File:
b = await file.read
b64 = base64.b64encode(b).decode("utf-8")
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "புலங்களுடன் சுருக்கமான JSON-ஐத் திருப்பி அனுப்பவும்: caption, objects[]."},
{"inline_data": {"mime_type": file.content_type, "data": b64}}
]
}],
"generationConfig": {"temperature": 0.2, "maxOutputTokens": 200}
}
r = requests.post(f"{ENDPOINT}?key={API_KEY}", json=payload, timeout=30)
r.raise_for_status
return r.json
சரிசெய்தல்
- மங்கலான வெளியீடுகள் அல்லது தவறவிட்ட உரை: Downscale குறைவாக; அதிக தெளிவுத்திறன் உள்ளீட்டைக் கோரவும்; OCR-ஐ வெளிப்படையாகக் கேட்கவும்
- முரண்பாடான JSON:
strict_json post-processor-ஐச் சேர்க்கவும் அல்லது fenced JSON ```json blocks-ஐக் கேட்கவும்
- Hallucinated விவரங்கள்: Temperature-ஐக் குறைக்கவும்; “தெரியவில்லை என்றால்,
தெரியாது என்று பதிலளிக்கவும்” என்று அறிவுறுத்தவும்
- Time-outs: முடிந்தால் ஸ்ட்ரீம் பதில்கள்; பட அளவைக் குறைக்கவும்; குறுகிய prompt-களை அமைக்கவும்
சந்தர்ப்பவசமாக: Sider.AI மூலம் முன்மாதிரியை விரைவுபடுத்துங்கள்
நீங்கள் நிறைய prompt வகைகளை உருவாக்கினால் அல்லது Gemini 2.5 Flash Image-க்கு விரைவான A/B சோதனைகள் தேவைப்பட்டால், Sider.AI வேகமாக மீண்டும் செய்ய உங்களுக்கு உதவ முடியும். நீங்கள் prompt பதிப்புகளை ஒழுங்கமைக்கலாம், உங்கள் படத் தொகுப்பில் பக்கவாட்டு மதிப்பீடுகளை இயக்கலாம் மற்றும் முழு backend-ஐயும் இணைக்காமல் தாமதம் மற்றும் துல்லியமான அளவீடுகளைப் பிடிக்கலாம் - தலைப்பிடுதல், OCR அல்லது காட்சி Q&A-க்காக prompt-களை சரிசெய்யும்போது இது உதவியாக இருக்கும்.
முக்கிய குறிப்புகள்
- வேகமான, குறைந்த விலை multimodal பணிகளுக்கு Gemini 2.5 Flash Image சிறந்தது
- நம்பகத்தன்மைக்கு துல்லியமான prompt-களை, JSON schemas மற்றும் குறைந்த temperatures-களைப் பயன்படுத்தவும்
- regression சோதனைகள் மூலம் மீண்டும் செய்யக்கூடிய மதிப்பீட்டுத் தொகுப்பை உருவாக்கி மாற்றங்களை கட்டுப்படுத்தவும்
- downscaling, caching மற்றும் batching மூலம் தாமதத்தை மேம்படுத்தவும்
- விரைவான prompt iteration மற்றும் பரிசோதனைக்கு Sider.AI-ஐக் கவனியுங்கள்
FAQ
Q1:Gemini 2.5 Flash Image (nano banana) என்றால் என்ன?
இது வேகமான, எடையற்ற multimodal மாதிரி, இது படத்தைப் புரிந்துகொள்ளுதல் மற்றும் எளிய பட எடிட்டிங் செய்வதற்கு ஏற்றது. “nano banana” புனைப்பெயர் பெரும்பாலும் உள் குறிச்சொல் அல்லது எடுத்துக்காட்டு மாறுபாட்டைக் குறிக்கிறது.
Q2:படத் தலைப்பிடுதலுக்காக Gemini 2.5 Flash Image-ஐ நான் எப்படி பயன்படுத்துவது?
உரை அறிவுறுத்தலையும் படத்தையும் base64 ஆக மாதிரியின் generateContent endpoint-க்கு அனுப்பவும். கட்டமைக்கப்பட்ட JSON-ஐக் (caption, objects, text_blocks) கேட்கவும், மேலும் நிலைத்தன்மைக்கு temperature-ஐக் குறைவாக வைக்கவும்.
Q3:Gemini 2.5 Flash Image, OCR அல்லது படங்களில் உள்ள உரையை கையாள முடியுமா?
ஆம், குறுகிய மற்றும் தெளிவான உரைகளுக்கு. சரியான படியெடுத்தல் தேவைகளை குறிப்பிடவும் மற்றும் ஒரு confidence புலத்தைச் சேர்க்கவும். அதிகப்படியான OCR-க்கு, மாதிரிக்கு கூடுதலாக ஒரு பிரத்யேக OCR கருவியைக் கவனியுங்கள்.
Q4:Gemini 2.5 Flash Image மூலம் தாமதம் மற்றும் செலவை நான் எப்படி குறைப்பது?
படங்களை நியாயமான அதிகபட்ச விளிம்பிற்கு Downscale செய்யவும், கோரிக்கைகளை batch செய்யவும் மற்றும் நிலையான முடிவுகளை cache செய்யவும். வெளியீட்டு அளவைக் கட்டுப்படுத்த குறைந்த temperatures-களைப் பயன்படுத்தவும் மற்றும் maxOutputTokens-ஐ வரம்பிடவும்.
Q5:Gemini 2.5 Flash Image மூலம் உருவாக்கும்போது Sider.AI எப்படி உதவும்?
Sider.AI prompt versioning மற்றும் மதிப்பீட்டை ஒழுங்குபடுத்துகிறது, இதன் மூலம் உங்கள் படத் தரவுத்தொகுப்பில் prompt-களை A/B சோதனை செய்யலாம், அளவீடுகளைக் கண்காணிக்கலாம் மற்றும் நம்பகமான உள்ளமைவுகளை உற்பத்தியில் வேகமாக மேம்படுத்தலாம்.