Sembang
Claw
Code
Create
Wisebase
Aplikasi
Harga
Tambah ke Chrome
Log Masuk
Log Masuk
Sembang
Claw
Code
Create
Wisebase
Aplikasi
Kembali ke Menu Utama
Produk
Aplikasi
  • Sambungan
  • iOS
  • Android
  • Mac OS
  • Windows
Wisebase
  • Wisebase
  • Deep Research
  • Scholar Research
  • Math Solver
  • Rec NoteNew
  • Audio To Text
  • Gamified Learning
  • Interactive Reading
  • ChatPDF
Alat
  • Pencipta WebNew
  • AI SlidesNew
  • Penulis Esei AI
  • Nano Banana Pro
  • Nano Banana Infographic
  • Penjana Imej AI
  • Generator Otak Itali
  • Penghilang Latar Belakang
  • Penukar Latar Belakang
  • Pemadam Foto
  • Penghilang Teks
  • Inpaint
  • Peningkat Resolusi Imej
  • Buat
  • Penterjemah AI
  • Penterjemah Imej
  • Penterjemah PDF
Sider
  • Hubungi Kami
  • Pusat Bantuan
  • Muat Turun
  • Harga
  • Pelan Pendidikan
  • Apa Yang Baru
  • Blog
  • Komuniti
  • Rakan Kongsi
  • Afiliasi
©2026 Hak Cipta Terpelihara
Syarat Penggunaan
Dasar Privasi
  • Halaman Utama
  • Blog
  • Other
  • Cara Membina dengan Imej Flash Gemini 2.5

Cara Membina dengan Imej Flash Gemini 2.5

Dikemas kini pada 11 Sep 2025

6 min


Cara Membina dengan Imej Flash Gemini 2.5 (nano banana)

Jika anda pernah mendengar tentang Imej Flash Gemini 2.5 yang baharu (sering muncul dengan nama kod unik "nano banana"), anda mungkin tertanya-tanya bagaimana untuk membina dengannya dengan pantas. Panduan ini membimbing anda melalui persediaan, gesaan dan corak pengeluaran supaya anda boleh menghantar ciri imej+teks dengan cepat dan boleh dipercayai.
Apa yang anda akan dapat: aliran kerja hujung-ke-hujung yang praktikal untuk menggunakan model Imej Flash Gemini 2.5, termasuk resipi gesaan, petua penilaian dan pengukuhan pengeluaran.

Apakah Imej Flash Gemini 2.5?

Imej Flash Gemini 2.5 ialah model multimodal yang ringan dan pantas yang ditala untuk tugas pemahaman dan penjanaan imej dengan kependaman rendah. Dalam praktiknya, ia sesuai untuk:
  • Pemahaman imej: mengklasifikasikan, memberikan kapsyen, OCR-lite, pengekstrakan reka letak
  • Soal Jawab Visual: menjawab soalan berdasarkan imej
  • Penjanaan atau penyuntingan imej ringan: variasi mudah, anotasi, tindanan
  • Pengalaman mesra-tepi: pratonton pantas, inferens kos rendah, UX interaktif
Moniker "Flash" secara amnya membayangkan kelajuan dan kos yang dioptimumkan. Nama panggilan "nano banana" biasanya merujuk kepada tag dalaman atau varian pusat pemeriksaan yang digunakan dalam contoh atau nota keluaran.

Prasyarat

  • Akaun Google AI Studio atau Vertex AI dengan akses kepada Imej Flash Gemini 2.5
  • Kunci API atau kelayakan akaun perkhidmatan
  • Runtime: Node.js, Python atau platform tanpa pelayan (Cloud Functions/Run)
  • Untuk pengeluaran: pengelogan, pengehadan kadar, penversian gesaan dan abah-abah penilaian

Permulaan Pantas: Pemahaman Imej

Di bawah ialah contoh Python minimum untuk Soal Jawab imej dan pemberian kapsyen. Gantikan ruang letak dengan kelayakan anda.
import base64
import requests
API_KEY = "{YOUR_API_KEY}"
MODEL = "gemini-2.5-flash-image" # atau nama model tepat pembekal
ENDPOINT = "{MODEL}
# Muatkan imej ke dalam base64
with open("./sample.jpg", "rb") as f:
image_b64 = base64.b64encode(f.read).decode("utf-8")
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "Terangkan imej ini dalam satu ayat, kemudian senaraikan tiga butiran utama."},
{
"inline_data": {
"mime_type": "image/jpeg",
"data": image_b64
}
}
]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 300
}
}
resp = requests.post(f"{ENDPOINT}?key={API_KEY}", json=payload)
resp.raise_for_status
print(resp.json["candidates"][0]["content"]["parts"][0]["text"])

Resipi gesaan untuk jawapan yang mantap

  • Niat sistem: “Anda ialah penganalisis visual yang tepat. Jika tidak pasti, katakan anda tidak pasti.”
  • Gesaan pengguna: “Jawab dengan ringkas. Petik isyarat yang boleh dilihat. Jika teks ada dalam imej, transkripsikan dengan tepat.”
  • Minta struktur: “Kembalikan JSON dengan kapsyen, objek[], blok_teks[].”
{
"caption": "<ringkasan satu ayat>",
"objects": [
{"label": "pisang", "count": 2},
{"label": "mangkuk", "count": 1}
],
"text_blocks": [
{"text": "NANO BANANA", "bbox": [x,y,w,h]}
]
}

Permulaan Pantas: Penjanaan/Penyuntingan Ringan

Untuk tindanan atau variasi mudah, banyak pembekal mendedahkan titik akhir imej-ke-imej. Pseudokod:
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "Tambahkan label halus 'Contoh' di sudut kanan atas."},
{"inline_data": {"mime_type": "image/png", "data": image_b64}}
]
}],
"generationConfig": {"temperature": 0.3, "maxOutputTokens": 0},
"tools": [{"imageEdit": {"strength": 0.25}}]
}
  • Kekalkan kekuatan rendah untuk pengeditan minimum.
  • Sentiasa nyatakan penempatan dan gaya: “kanan atas, 12px, putih separa lut sinar.”
  • Untuk pematuhan, jangan sekali-kali meminta untuk mencipta semula imej yang mempunyai tera air atau hak cipta.

Membina Saluran Paip yang Boleh Dipercayai

1) Tentukan tugas dan kriteria penerimaan

  • Pemberian kapsyen imej: WER pada teks yang boleh dilihat < 10%, kapsyen <= 20 perkataan
  • Soal Jawab Visual: padanan tepat pada fakta utama; benarkan sandaran "tidak pasti"
  • Pengekstrakan reka letak: ketepatan/ingatan semula pada entiti seperti harga, tarikh, SKU

2) Strukturkan gesaan

  • Arahan dahulu, kemudian imej
  • Format output: Skema JSON dengan jenis medan
  • Langkah keselamatan: “Jika teks tidak kelihatan, kembalikan null”

3) Kelompok dan cache

  • Kelompokkan permintaan imej apabila boleh
  • Cache hasil yang stabil (cth., foto produk yang tidak berubah)
  • Gunakan ETag atau cincangan kandungan untuk menyahduplikasi

4) Nilaikan secara sistematik

  • Bina set emas kecil: 100–500 imej dengan label kebenaran dasar
  • Jejaki metrik: ketepatan, kadar halusinasi, kependaman respons
  • Buat suite regresi setiap versi gesaan

5) Kawalan pengeluaran

  • Tetapkan maxOutputTokens dengan ketat untuk output deterministik
  • Gunakan suhu yang lebih rendah (0.1–0.4) untuk tugas faktual
  • Hadkan kadar mengikut pengguna dan organisasi; tambahkan pengurangan eksponen
  • Log input/output (cincang imej, bukan mentah untuk privasi)

Kes Penggunaan dan Corak Biasa

Carian Produk Visual

  • Telan imej katalog, ekstrak objek, warna_dominan, gaya
  • Pada masa pertanyaan, bandingkan pembenaman atau atribut
  • Corak gesaan: “Kembalikan 5 atribut teratas yang akan membantu pembeli membuat keputusan.”

OCR Lite Dokumen

  • Minta model untuk mentranskripsikan blok teks yang pendek dan jelas
  • Tambahkan kekangan: “Kembalikan kes dan tanda baca yang tepat; jika tidak dapat dibaca, tetapkan keyakinan: rendah.”

UX Copilot untuk Tangkapan Skrin

  • Input: tangkapan skrin aplikasi
  • Output: langkah sebagai titik-titik: “Bagaimana cara saya memusatkan teks?” → model mengembalikan laluan menu

Petua Kos dan Kependaman

  • Utamakan “Flash” untuk pratonton dan UX berulang; tingkatkan kepada varian Gemini yang lebih besar untuk semakan akhir
  • Kecilkan skala kepada tepi maksimum (cth., 1024px) untuk mengurangkan lebar jalur tanpa kehilangan butiran utama
  • Gunakan semula pembenaman atau ringkasan perantaraan apabila merantai tugas

Keselamatan, Privasi dan Perlindungan

  • Redaksi PII sebelum pengelogan; gunakan cincangan kandungan untuk ID imej
  • Kuatkuasakan senarai benarkan saiz/jenis: jpeg, png; tolak svg/exe
  • Tambahkan perlindungan gesaan: “Tolak jika diminta untuk mengenal pasti individu persendirian”

Contoh: Perkhidmatan Mikro Pemberian Kapsyen Hujung-ke-Hujung

from fastapi import FastAPI, UploadFile, File
import base64, requests, os
app = FastAPI
API_KEY = os.getenv("API_KEY")
MODEL = "gemini-2.5-flash-image"
ENDPOINT = f"("/caption")
async def caption(file: UploadFile = File:
b = await file.read
b64 = base64.b64encode(b).decode("utf-8")
payload = {
"contents": [{
"role": "user",
"parts": [
{"text": "Kembalikan JSON ringkas dengan medan: kapsyen, objek[]."},
{"inline_data": {"mime_type": file.content_type, "data": b64}}
]
}],
"generationConfig": {"temperature": 0.2, "maxOutputTokens": 200}
}
r = requests.post(f"{ENDPOINT}?key={API_KEY}", json=payload, timeout=30)
r.raise_for_status
return r.json

Penyelesaian Masalah

  • Output kabur atau teks terlepas: Kecilkan skala kurang; minta input resolusi lebih tinggi; minta OCR secara eksplisit
  • JSON tidak konsisten: Tambahkan pemproses pasca strict_json, atau minta blok JSON ```json berpagar
  • Butiran yang dihalusinasi: Turunkan suhu; arahkan “Jika tidak pasti, balas tidak pasti”
  • Tamat masa: Strim respons jika tersedia; kurangkan saiz imej; tetapkan gesaan yang lebih pendek

Ngomong-ngomong: Percepatkan prototaip dengan Sider.AI

Jika anda membina banyak varian gesaan atau memerlukan ujian A/B pantas untuk Imej Flash Gemini 2.5, Sider.AI boleh membantu anda membuat lelaran dengan lebih pantas. Anda boleh menyusun versi gesaan, menjalankan penilaian sebelah menyebelah pada set imej anda dan menangkap metrik kependaman dan ketepatan tanpa memasang bahagian belakang penuh—berguna apabila anda menala gesaan untuk pemberian kapsyen, OCR atau Soal Jawab visual.

Perkara Utama

  • Imej Flash Gemini 2.5 bagus untuk tugas multimodal yang pantas dan kos rendah
  • Gunakan gesaan yang tepat, skema JSON dan suhu rendah untuk kebolehpercayaan
  • Bina set penilaian berulang dan perubahan get dengan ujian regresi
  • Optimumkan kependaman dengan pengecilan skala, caching dan pengelompokan
  • Pertimbangkan Sider.AI untuk lelaran dan eksperimen gesaan pantas

Soalan Lazim

S1:Apakah Imej Flash Gemini 2.5 (nano banana)? Ia ialah model multimodal yang pantas dan ringan yang dioptimumkan untuk pemahaman imej dan pengeditan imej mudah. Nama panggilan “nano banana” selalunya merujuk kepada tag dalaman atau varian contoh.
S2:Bagaimanakah cara saya menggunakan Imej Flash Gemini 2.5 untuk pemberian kapsyen imej? Hantar arahan teks serta imej sebagai base64 ke titik akhir generateContent model. Minta JSON berstruktur (kapsyen, objek, blok_teks) dan kekalkan suhu rendah untuk ketekalan.
S3:Bolehkah Imej Flash Gemini 2.5 mengendalikan OCR atau teks dalam imej? Ya, untuk teks yang pendek dan jelas. Nyatakan keperluan transkripsi yang tepat dan sertakan medan keyakinan. Untuk OCR tugas berat, pertimbangkan alat OCR khusus bersama model.
S4:Bagaimanakah cara saya meminimumkan kependaman dan kos dengan Imej Flash Gemini 2.5? Kecilkan skala imej kepada tepi maksimum yang munasabah, kelompokkan permintaan dan cache hasil yang stabil. Gunakan suhu yang lebih rendah dan hadkan maxOutputTokens untuk mengawal saiz output.
S5:Bagaimanakah Sider.AI boleh membantu apabila membina dengan Imej Flash Gemini 2.5? Sider.AI menyelaraskan penversian dan penilaian gesaan supaya anda boleh menguji A/B gesaan pada set data imej anda, menjejak metrik dan mempromosikan konfigurasi yang boleh dipercayai kepada pengeluaran dengan lebih pantas.

Artikel Terkini
10 Cara Terbaik Cermin Mata Pintar AI Amazon Meningkatkan Kecekapan dan Keselamatan Penghantaran

10 Cara Terbaik Cermin Mata Pintar AI Amazon Meningkatkan Kecekapan dan Keselamatan Penghantaran

Bagaimana Cermin Mata Pintar Berkuasa AI Amazon Mengubah Penghantaran Batu Terakhir

Bagaimana Cermin Mata Pintar Berkuasa AI Amazon Mengubah Penghantaran Batu Terakhir

Peranti Boleh Dipakai AI dalam Logistik: Alat Berguna, Bukan Tongkat Sakti

Peranti Boleh Dipakai AI dalam Logistik: Alat Berguna, Bukan Tongkat Sakti

Cermin Mata Pintar Amazon untuk Pemandu: Lima Ciri, Satu Strategi

Cermin Mata Pintar Amazon untuk Pemandu: Lima Ciri, Satu Strategi

Mengapa Amazon Memilih Cermin Mata Pintar Berbanding Telefon untuk Penghantaran

Mengapa Amazon Memilih Cermin Mata Pintar Berbanding Telefon untuk Penghantaran

Bagaimana Cermin Mata Pintar Penghantaran Amazon Menggunakan Penglihatan Komputer untuk Membimbing Pemandu

Bagaimana Cermin Mata Pintar Penghantaran Amazon Menggunakan Penglihatan Komputer untuk Membimbing Pemandu