Chat
Claw
Code
Create
Wisebase
App
Prezzi
Aggiungi a Chrome
Accedi
Accedi
Chat
Claw
Code
Create
Wisebase
App
Torna al menu principale
Prodotti
App
  • Estensioni
  • iOS
  • Android
  • Mac OS
  • Windows
Wisebase
  • Wisebase
  • Deep Research
  • Scholar Research
  • Math Solver
  • Rec NoteNew
  • Audio To Text
  • Gamified Learning
  • Interactive Reading
  • ChatPDF
Strumenti
  • Creatore di Siti WebNew
  • AI SlidesNew
  • Scrittore di saggi AI
  • Nano Banana Pro
  • Nano Banana Infographic
  • Generatore di immagini AI
  • Generatore di Brainrot Italiano
  • Rimuovi sfondo
  • Cambia sfondo
  • Cancellatore di foto
  • Rimuovi testo
  • Ritocca
  • Ingranditore di immagini
  • Crea
  • Traduttore AI
  • Traduttore di immagini
  • Traduttore PDF
Sider
  • Contattaci
  • Centro assistenza
  • Scarica
  • Prezzi
  • Piano Educativo
  • Novità
  • Blog
  • Comunità
  • Partner
  • Affiliazione
©2026 Tutti i diritti riservati
Termini di utilizzo
Informativa sulla privacy
  • Pagina iniziale
  • Blog
  • Other
  • Come creare con Gemini 2.5 Flash Image

Come creare con Gemini 2.5 Flash Image

Aggiornato il 11 set 2025

6 min


Come creare con Gemini 2.5 Flash Image (nano banana)

Se hai sentito parlare della nuova Gemini 2.5 Flash Image (spesso indicata con il bizzarro nome in codice “nano banana”), probabilmente ti starai chiedendo come realizzarla concretamente, e velocemente. Questa guida ti illustra la configurazione, i prompt e i modelli di produzione in modo che tu possa rilasciare funzionalità di immagine+testo in modo rapido e affidabile.
Cosa otterrai: un flusso di lavoro pratico e completo per l'utilizzo del modello Gemini 2.5 Flash Image, comprese ricette di prompt, suggerimenti per la valutazione e rafforzamento della produzione.

Cos'è Gemini 2.5 Flash Image?

Gemini 2.5 Flash Image è un modello multimodale leggero e veloce, ottimizzato per attività di comprensione e generazione di immagini a bassa latenza. In pratica, è ideale per:
  • Comprensione delle immagini: classificazione, didascalie, OCR semplificato, estrazione del layout
  • Q&A visivo: rispondere a domande basate su un'immagine
  • Generazione o modifica di immagini leggera: variazioni semplici, annotazioni, sovrapposizioni
  • Esperienze adatte all'edge: anteprime rapide, inferenza a basso costo, UX interattiva
Il termine “Flash” implica generalmente velocità e costi ottimizzati. Il soprannome “nano banana” si riferisce in genere a un tag interno o a una variante di checkpoint utilizzata negli esempi o nelle note di rilascio.

Prerequisiti

  • Un account Google AI Studio o Vertex AI con accesso a Gemini 2.5 Flash Image
  • Chiave API o credenziali dell'account di servizio
  • Runtime: Node.js, Python o piattaforma serverless (Cloud Functions/Run)
  • Per la produzione: registrazione, limitazione della frequenza, versioning dei prompt e sistema di valutazione

Guida rapida: Comprensione delle immagini

Di seguito è riportato un esempio Python minimo per Q&A e didascalie di immagini. Sostituisci i segnaposto con le tue credenziali.
import base64
import requests
API_KEY = "{YOUR_API_KEY}"
MODEL = "gemini-2.5-flash-image" # o il nome esatto del modello del provider
ENDPOINT = "(MODEL)
# Carica un'immagine in base64
with open("./sample.jpg", "rb") as f:
image_b64 = base64.b64encode(f.read).decode("utf-8")
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "Descrivi questa immagine in una frase, quindi elenca tre dettagli chiave."},
{
"inline_data": {
"mime_type": "image/jpeg",
"data": image_b64
}
}
]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 300
}
}
resp = requests.post(f"{ENDPOINT}?key={API_KEY}", json=payload)
resp.raise_for_status
print(resp.json["candidates"][0]["content"]["parts"][0]["text"])

Ricetta di prompt per risposte robuste

  • Intento del sistema: “Sei un analista visivo preciso. Se non sei sicuro, dì che non sei sicuro.”
  • Prompt utente: “Rispondi in modo conciso. Cita indizi visibili. Se nell'immagine è presente del testo, trascrivilo esattamente.”
  • Chiedi la struttura: “Restituisci JSON con caption, objects[], text_blocks[].”
{
"caption": "<riepilogo di una frase>",
"objects": [
{"label": "banana", "count": 2},
{"label": "bowl", "count": 1}
],
"text_blocks": [
{"text": "NANO BANANA", "bbox": [x,y,w,h]}
]
}

Guida rapida: Generazione/Modifica leggera

Per semplici sovrapposizioni o variazioni, molti provider espongono un endpoint da immagine a immagine. Pseudocodice:
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "Aggiungi un'etichetta discreta 'Sample' nell'angolo in alto a destra."},
{"inline_data": {"mime_type": "image/png", "data": image_b64}}
]
}],
"generationConfig": {"temperature": 0.3, "maxOutputTokens": 0},
"tools": [{"imageEdit": {"strength": 0.25}}]
}
  • Mantieni strength basso per modifiche minime.
  • Specifica sempre il posizionamento e lo stile: “in alto a destra, 12px, bianco semitrasparente.”
  • Per conformità, non chiedere mai di ricreare immagini con filigrana o protette da copyright.

Costruire una pipeline affidabile

1) Definisci le attività e i criteri di accettazione

  • Didascalie di immagini: WER sul testo visibile < 10%, didascalia <= 20 parole
  • Q&A visivo: corrispondenza esatta sui fatti chiave; consenti fallback “non sicuro”
  • Estrazione del layout: precisione/richiamo su entità come prezzo, data, SKU

2) Struttura i prompt

  • Istruzione prima, poi immagine
  • Formato di output: schema JSON con tipi di campo
  • Guardrail: “Se il testo non è visibile, restituisci null”

3) Elabora in batch e memorizza nella cache

  • Elabora le richieste di immagini in batch quando possibile
  • Memorizza nella cache i risultati stabili (ad esempio, le foto dei prodotti che non cambiano)
  • Utilizza ETags o hash di contenuto per deduplicare

4) Valuta sistematicamente

  • Crea un piccolo set gold: 100–500 immagini con etichette ground-truth
  • Monitora le metriche: accuratezza, tasso di allucinazione, latenza della risposta
  • Crea una suite di regressione per ogni versione del prompt

5) Controlli di produzione

  • Imposta maxOutputTokens in modo preciso per output deterministici
  • Utilizza una temperature inferiore (0,1–0,4) per attività fattuali
  • Limita la frequenza per utente e organizzazione; aggiungi backoff esponenziale
  • Registra input/output (esegui l'hash dell'immagine, non grezza per la privacy)

Casi d'uso e modelli comuni

Ricerca visiva di prodotti

  • Acquisisci immagini di catalogo, estrai objects, dominant_color, style
  • Al momento della query, confronta incorporamenti o attributi
  • Modello di prompt: “Restituisci i 5 attributi principali che aiuterebbero un acquirente a decidere.”

OCR Lite per documenti

  • Chiedi al modello di trascrivere blocchi di testo brevi e chiari
  • Aggiungi vincoli: “Restituisci maiuscole e minuscole e punteggiatura esatte; se illeggibile, imposta confidence: low.”

Copilot UX per screenshot

  • Input: screenshot dell'app
  • Output: passaggi come punti elenco: “Come faccio a centrare il testo?” → il modello restituisce il percorso del menu

Suggerimenti su costi e latenza

  • Preferisci “Flash” per anteprime e UX iterativa; passa a varianti Gemini più grandi per i controlli finali
  • Riduci a una dimensione massima (ad esempio, 1024 px) per ridurre la larghezza di banda senza perdere dettagli chiave
  • Riutilizza incorporamenti o riepiloghi intermedi quando concateni le attività

Sicurezza, privacy e protezione

  • Redigi le informazioni personali prima della registrazione; utilizza l'hashing del contenuto per gli ID immagine
  • Applica allowlist di dimensioni/tipo: jpeg, png; rifiuta svg/exe
  • Aggiungi misure di sicurezza del prompt: “Rifiuta se viene chiesto di identificare persone private”

Esempio: Microservizio di didascalie end-to-end

from fastapi import FastAPI, UploadFile, File
import base64, requests, os
app = FastAPI
API_KEY = os.getenv("API_KEY")
MODEL = "gemini-2.5-flash-image"
ENDPOINT = f"("/caption")
async def caption(file: UploadFile = File:
b = await file.read
b64 = base64.b64encode(b).decode("utf-8")
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "Restituisci JSON conciso con i campi: caption, objects[]."},
{"inline_data": {"mime_type": file.content_type, "data": b64}}
]
}],
"generationConfig": {"temperature": 0.2, "maxOutputTokens": 200}
}
r = requests.post(f"{ENDPOINT}?key={API_KEY}", json=payload, timeout=30)
r.raise_for_status
return r.json

Risoluzione dei problemi

  • Output sfocati o testo mancante: Riduci meno la dimensione; richiedi input a risoluzione più alta; chiedi esplicitamente l'OCR
  • JSON incoerente: Aggiungi il post-processore strict_json o chiedi blocchi JSON recintati ```json
  • Dettagli allucinati: Abbassa la temperatura; istruisci “Se non sei sicuro, rispondi unsure”
  • Timeout: Trasmetti le risposte in streaming se disponibili; riduci le dimensioni dell'immagine; imposta prompt più brevi

A proposito: accelera la prototipazione con Sider.AI

Se stai creando molte varianti di prompt o hai bisogno di test A/B rapidi per Gemini 2.5 Flash Image, Sider.AI può aiutarti a iterare più velocemente. Puoi organizzare le versioni dei prompt, eseguire valutazioni affiancate sul tuo set di immagini e acquisire metriche di latenza e accuratezza senza cablare un backend completo, utile quando stai ottimizzando i prompt per didascalie, OCR o Q&A visivo.

Punti chiave

  • Gemini 2.5 Flash Image è ottimo per attività multimodali veloci ed economiche
  • Utilizza prompt precisi, schemi JSON e temperature basse per l'affidabilità
  • Crea un set di valutazione ripetibile e cancella le modifiche con test di regressione
  • Ottimizza la latenza con riduzione delle dimensioni, memorizzazione nella cache e batching
  • Considera Sider.AI per un'iterazione e una sperimentazione rapida dei prompt

Domande frequenti

D1: Cos'è Gemini 2.5 Flash Image (nano banana)? È un modello multimodale veloce e leggero ottimizzato per la comprensione delle immagini e semplici modifiche alle immagini. Il soprannome “nano banana” si riferisce spesso a un tag interno o a una variante di esempio.
D2: Come posso utilizzare Gemini 2.5 Flash Image per la didascalia delle immagini? Invia un'istruzione di testo più l'immagine come base64 all'endpoint generateContent del modello. Richiedi JSON strutturato (didascalia, oggetti, blocchi di testo) e mantieni bassa la temperatura per coerenza.
D3: Gemini 2.5 Flash Image è in grado di gestire OCR o testo nelle immagini? Sì, per testi brevi e chiari. Specifica i requisiti esatti di trascrizione e includi un campo di confidenza. Per OCR pesante, considera uno strumento OCR dedicato insieme al modello.
D4: Come posso ridurre al minimo la latenza e i costi con Gemini 2.5 Flash Image? Riduci le immagini a una dimensione massima ragionevole, elabora le richieste in batch e memorizza nella cache i risultati stabili. Utilizza temperature più basse e limita maxOutputTokens per controllare le dimensioni dell'output.
D5: In che modo Sider.AI può aiutare durante la creazione con Gemini 2.5 Flash Image? Sider.AI semplifica il versioning e la valutazione dei prompt in modo da poter eseguire test A/B dei prompt sul tuo set di dati di immagini, monitorare le metriche e promuovere configurazioni affidabili in produzione più velocemente.

Articoli Recenti
I 10 modi principali in cui gli occhiali AI di Amazon aumentano l'efficienza e la sicurezza delle consegne

I 10 modi principali in cui gli occhiali AI di Amazon aumentano l'efficienza e la sicurezza delle consegne

Come gli occhiali intelligenti di Amazon, potenziati dall'IA, stanno cambiando la consegna dell'ultimo miglio

Come gli occhiali intelligenti di Amazon, potenziati dall'IA, stanno cambiando la consegna dell'ultimo miglio

Dispositivi indossabili con IA nella logistica: strumenti utili, non bacchette magiche

Dispositivi indossabili con IA nella logistica: strumenti utili, non bacchette magiche

Gli occhiali smart di Amazon per gli autisti: cinque funzionalità, una strategia

Gli occhiali smart di Amazon per gli autisti: cinque funzionalità, una strategia

Perché Amazon ha scelto gli smart glasses invece dei telefoni per le consegne

Perché Amazon ha scelto gli smart glasses invece dei telefoni per le consegne

Come gli occhiali intelligenti per le consegne di Amazon utilizzano la visione artificiale per guidare i conducenti

Come gli occhiali intelligenti per le consegne di Amazon utilizzano la visione artificiale per guidare i conducenti