چت
Claw
Code
Create
Wisebase
برنامه‌ها
قیمت‌گذاری
افزودن به Chrome
ورود
ورود
چت
Claw
Code
Create
Wisebase
برنامه‌ها
بازگشت به منوی اصلی
محصولات
برنامه‌ها
  • افزونه‌ها
  • iOS
  • Android
  • Mac OS
  • Windows
Wisebase
  • Wisebase
  • Deep Research
  • Scholar Research
  • Math Solver
  • Rec NoteNew
  • Audio To Text
  • Gamified Learning
  • Interactive Reading
  • ChatPDF
ابزارها
  • سازنده وبNew
  • اسلایدهای هوش مصنوعیNew
  • نویسنده مقاله هوش مصنوعی
  • Nano Banana Pro
  • Nano Banana Infographic
  • تولیدکننده تصویر هوش مصنوعی
  • ژنراتور اختلال ذهنی ایتالیایی
  • حذف‌کننده پس‌زمینه
  • تغییر دهنده پس‌زمینه
  • پاک‌کننده عکس
  • حذف‌کننده متن
  • نقاشی مجدد
  • ارتقاء دهنده تصویر
  • ایجاد
  • مترجم هوش مصنوعی
  • مترجم تصویر
  • مترجم PDF
Sider
  • تماس با ما
  • مرکز راهنما
  • دانلود
  • قیمت‌گذاری
  • برنامه آموزشی
  • چه چیز جدید است
  • وبلاگ
  • جامعه
  • شرکا
  • همکاری در فروش
©2026 تمام حقوق محفوظ است
شرایط استفاده
سیاست حفظ حریم خصوصی
  • صفحه اصلی
  • وبلاگ
  • تصویر هوش مصنوعی
  • مدل‌های Stable Diffusion چه هستند؟ راهنمای عملی و مدرن هوش مصنوعی تبدیل متن به تصویر

مدل‌های Stable Diffusion چه هستند؟ راهنمای عملی و مدرن هوش مصنوعی تبدیل متن به تصویر

به‌روزرسانی شده در 10 اکتبر 2025

8 دقیقه


یک جهش جسورانه: اکنون کلمات شما می توانند تصاویر را نقاشی کنند

تصور کنید تایپ می کنید «یک روباه آبرنگ که زیر یک فانوس در یک کوچه بارانی کتاب می خواند» و تماشا می کنید که یک تصویر واضح در عرض چند ثانیه ظاهر می شود. این جادوی روزمره مدل های Stable Diffusion است—سیستم های متن به تصویر باز و انعطاف پذیر که همه چیز را از ماکت های بازاریابی گرفته تا دارایی های بازی های مستقل تامین می کنند. اما آنها چگونه کار می کنند، از کدام مدل ها باید استفاده کنید و چگونه بدون یک ابررایانه به نتایج حرفه ای برسید؟
این راهنما مدل های Stable Diffusion را به زبان ساده شرح می دهد. ما اکوسیستم را پوشش خواهیم داد، نحوه انتخاب ایست بازرسی مناسب، زمان استفاده از LoRA در مقابل ControlNet و مراحل عملی برای تولیدات مداوم و با کیفیت بالا.

مدل Stable Diffusion واقعاً چیست؟

  • در هسته خود، Stable Diffusion یک مدل انتشار است که برای تبدیل نویز به یک تصویر بر اساس یک دستور متنی آموزش داده شده است. این مدل "نهفته" است زیرا در یک فضای تصویر فشرده عمل می کند، که آن را سریع و نسبتاً سبک می کند.
  • مدل ها به صورت "checkpoints" (مغز اصلی) ارائه می شوند و می توانند با آداپتورهای کوچکتر مانند LoRA و Textual Inversions برای کنترل سبک یا موضوع گسترش یابند.
  • این خانواده شامل SD 1.x (اکوسیستم باز کلاسیک)، SD 2.x (معماری جدیدتر با رمزگذارهای متنی متفاوت) و SDXL (کیفیت بالاتر، ترکیب بندی و جزئیات بهتر) است.
چرا مهم است: مدل های Stable Diffusion محلی پسند، قابل تنظیم و مبتنی بر جامعه هستند. شما می توانید آنها را روی یک GPU واحد یا ابر اجرا کنید، سبک ها را بهینه کنید و آداپتورها را برای کارهای خاص تعویض کنید.

نگاهی اجمالی به اکوسیستم Stable Diffusion (مبتنی بر سوال)

کدام مدل های پایه را باید در نظر بگیرم؟

  • SD 1.5: اسب بارکش جامعه. پشتیبانی گسترده LoRA/Textual Inversion؛ عالی برای هنر سبک دار، مفهوم سازی، انیمه و تصویرسازی.
  • SD 2.1: معماری تمیزتر و بهبودهای عمق/لبه، اما کتابخانه آداپتور کوچکتر در مقایسه با 1.5.
  • SDXL (پایه + Refiner): بهترین کیفیت در کلاس جهانی باز. انسان ها، تایپوگرافی و نورپردازی منسجم تر. عالی برای عکس های محصول، پوسترها، صحنه های واقع گرایانه و خروجی های آماده ارتقاء.

مشتقات محبوب و ایست های بازرسی هدفمند کدامند؟

  • Realistic Vision / DreamShaper (خانواده 1.5): واقع گرایی و سبک متعادل؛ خوب برای پرتره ها و استفاده عمومی.
  • Juggernaut / Photon (خانواده SDXL): جزئیات بالا و فوتورئالیسم در SDXL.
  • مدل های متمرکز بر انیمه (Anything, AOM, Counterfeit): خروجی های سبک دار مطابق با انیمه/مانگا.
  • مدل های Inpainting: تخصصی برای ویرایش قسمت هایی از یک تصویر با ترکیب یکپارچه.

در مورد آداپتورها چطور؟

  • LoRA: افزونه های کوچک که یک سبک، شخصیت یا ظاهر محصول جدید را بدون آموزش مجدد کامل به یک مدل پایه آموزش می دهند.
  • ControlNet: راهنمایی ساختاری (ژست، عمق، لبه ها، خط خطی ها). دقت طرح بندی را تضمین می کند—به زوایای محصول، معماری و ژست های ثابت فکر کنید.
  • Textual Inversion (embeddings): نشانه های فوری که نشان دهنده یک مفهوم آموخته شده است (به عنوان مثال، یک لوگو یا نقش هنری خاص).

مدل های Stable Diffusion چگونه تصاویر را تولید می کنند (سفر ساده)

  1. از نویز شروع کنید: مدل با نویز تصادفی در فضای پنهان شروع می شود.
  1. کاهش نویز هدایت شده: در طول 20-50 مرحله، به سمت یک تصویر هدایت شده توسط دستور شما، نویز را کاهش می دهد.
  1. Conditioning: دستور متنی شما (از طریق یک رمزگذار متن) کاهش نویز را هدایت می کند. ControlNet یا دستورات تصویری ساختار را فراهم می کنند.
  1. Decoding: پنهان نهایی به یک تصویر با وضوح کامل رمزگشایی می شود.
شما این فرآیند را با موارد زیر کنترل می کنید:
  • مقیاس راهنمایی (CFG): مقادیر بالاتر به شدت از دستور پیروی می کنند. خیلی زیاد می تواند بیش از حد پخته به نظر برسد. محدوده معمول: 3-9 برای SDXL، 5-12 برای 1.5.
  • Sampler و مراحل: DPM++ 2M و Euler a محبوب هستند. 20-35 مرحله اغلب کافی است. SDXL اغلب در 25 ~ عالی به نظر می رسد.
  • Seeds: یک seed نقطه شروع نویز را ثابت می کند. همان seed + همان تنظیمات = نتیجه قابل تکرار.

انتخاب مدل Stable Diffusion مناسب برای هدف شما (لیست)

  • پرتره های فوق العاده واقعی: SDXL + یک ایست بازرسی متمرکز بر واقع گرایی (به عنوان مثال، Juggernaut) با یک LoRA آگاه از رنگ پوست در صورت نیاز.
  • هنر مفهومی سبک دار: SD 1.5 + DreamShaper یا LoRA سبک هنری خاص. از 768×768 برای جزئیات بیشتر شروع کنید.
  • تصاویر بازاریابی/محصول: SDXL پایه + ControlNet-Depth برای هندسه دقیق محصول. یک گذر Refiner را در 0.2-0.4 denoise برای پایان واضح اضافه کنید.
  • انیمه و هنر شخصیت: ایست های بازرسی انیمه مبتنی بر 1.5 (Anything, AOM) + pose ControlNet برای ترکیب بندی پویا.
  • فضاهای داخلی معماری: SDXL + ControlNet-Edge/Lineart؛ ارتقاء مقیاس کاشی کاری شده را برای وضوح چاپ آماده در نظر بگیرید.
  • متن و ماکت های UI: SDXL در متن شبه خوانا بهتر است. برای متن واقعی، طرح بندی ها را به صورت خارجی ایجاد و inpaint کنید.

دستوراتی که به طور مداوم کار می کنند (با مثال)

دستورات قوی بتنی و لایه ای هستند. از نقش + موضوع + صحنه + سبک + نورپردازی + لنز استفاده کنید.
  • محصول Photoreal: “عکس استودیویی از یک قطره چکان قهوه سرامیکی روی یک میز چوبی گردو، نور ملایم صبح، لنز 85 میلی متری، عمق میدان کم، SDXL، جزئیات بالا، ویترین محصول.”
  • پرتره Editorial: “پرتره صریح از یک مهندس نرم افزار در یک فضای کار مشترک آفتابی، بافت طبیعی پوست، نور لبه نرم، زیبایی شناسی Kodak Portra 400، واقع گرایی SDXL.”
  • هنر مفهومی: “شهر باستانی بیابانی در هنگام غروب، طاق های ماسه سنگی، فانوس های شناور، مقیاس چشمگیر، قلم موهای نقاشانه، فضای سینمایی، مه حجمی، رنگ 32 بیتی، SD 1.5 DreamShaper.”
  • شخصیت انیمه: “قهرمان زن در یک کوچه بارانی نئونی، گودال های بازتابنده، ژست پویا، خطوط حرکت اکشن، پالت زنده، خطوط انیمه، 1.5 Anything v4.”
از دستورات منفی برای مشکلات احتمالی استفاده کنید: “آناتومی بد، انگشتان اضافی، تار، واترمارک، متن تغییر شکل یافته، کنتراست کم.” منفی ها را متمرکز نگه دارید—تعداد زیاد می تواند با یکدیگر مبارزه کند.

کنترل و سازگاری با ControlNet (عملی و مستقیم)

  • Pose (OpenPose): موقعیت های بدن را از عکس های مرجع بازتولید کنید—ایده آل برای کمپین هایی که سازگاری در آنها مهم است.
  • عمق: ساختار سه بعدی محصولات یا معماری را در حین بررسی مواد و سبک ها حفظ کنید.
  • Canny/Lineart: لبه ها را برای آرم ها، بسته بندی یا فریم های UI حفظ کنید؛ عالی برای تکرارهای دقیق برند.
  • Scribble: یک طرح بندی را ترسیم کنید و اجازه دهید مدل جزئیات را پر کند—ایده پردازی سریع برای استوری بورد.
نکته گردش کار: با ControlNet برای ساختار شروع کنید، سپس دستورات و LoRA ها را برای سبک تکرار کنید. seed را برای تست های A/B قفل کنید. فقط یک متغیر را در یک زمان تغییر دهید.

LoRA در مقابل تنظیم دقیق کامل در مقابل Textual Inversion (مزایا و معایب)

  • LoRA:
  • مزایا: سبک وزن، سریع برای آموزش، قابل انباشت. ایده آل برای افزودن سبک ها/شخصیت ها.
  • معایب: می تواند بیش از حد مناسب باشد یا با سایر LoRA ها تضاد داشته باشد. نیاز به نظم و انضباط سریع دارد.
  • تنظیم دقیق کامل (DreamBooth, SDXL training):
  • مزایا: کنترل عمیق، بهترین برای کاتالوگ های محصول اختصاصی یا راهنماهای سبک برند.
  • معایب: گران، کندتر، نگهداری در بین ارتقاء مدل دشوارتر است.
  • Textual Inversion:
  • مزایا: کوچک، به اشتراک گذاری آسان، خوب برای نقوش انتزاعی یا پالت های رنگی.
  • معایب: کمتر از LoRA رسا است. می تواند در بین مدل های پایه شکننده باشد.
قانون تصمیم گیری: با یک پایه قوی (اغلب SDXL) شروع کنید، LoRA را برای سبک اضافه کنید و فقط در صورتی به تنظیم دقیق کامل بروید که به سازگاری درجه سازمانی نیاز دارید.

وضوح، ارتقاء مقیاس و SDXL Refiner

  • بوم اصلی:
  • SD 1.5: پیش فرض 512×512؛ برای خروجی های بزرگتر، مقیاس را افزایش دهید یا از رفع hires استفاده کنید.
  • SDXL: 1024×1024 بومی؛ جزئیات واضح تر و مدیریت متن را ارائه می دهد.
  • گزینه های ارتقاء مقیاس: ارتقاء دهنده های مقیاس پنهان، انواع ESRGAN و ارتقاء دهنده های مقیاس SDXL اختصاصی. 1.5×–2× در هر گذر بروید تا از مصنوعات جلوگیری کنید.
  • Refiner (SDXL): یک مدل ثانویه که جزئیات فرکانس متوسط/بالا را صیقل می دهد. از 0.2-0.4 denoise با SDXL Refiner پس از پایه برای نتایج براق استفاده کنید.

اشتباهات رایج—و نحوه رفع آنها (عیب یابی)

  • CFG بیش از حد بالا: کنتراست شدید و پوست پلاستیکی. راه حل: آن را به 3-7 (SDXL) یا 5-9 (1.5) کاهش دهید و نور را دوباره متعادل کنید.
  • LoRA های خیلی زیاد: برخورد سبک و هرج و مرج. راه حل: از 1-2 در وزن های متوسط استفاده کنید. ابتدا به صورت جداگانه آزمایش کنید.
  • Seeds تصادفی هر بار: خروجی های ناسازگار. راه حل: seed را در حین شماره گیری در دستورات ثابت کنید. بعد از آن تصادفی کنید.
  • دستورات بیش از حد دقیق: دستورالعمل های متناقض. راه حل: یک شرح اصلی را نگه دارید و 3-5 نشانه سبک اضافه کنید.
  • متن لکه دار: نواحی متنی Inpaint با مرجع؛ ترکیب بندی متن را در خارج از مدل در نظر بگیرید.

استفاده اخلاقی، مجوز و ایمنی

  • نگرانی های مربوط به داده های منبع: مدل های انجمن ممکن است از داده های گسترده وب یاد بگیرند. برای کارهای تجاری، مجوزهای مدل و خط مشی سازمان خود را بررسی کنید.
  • حریم خصوصی: از آموزش بر روی تصاویر اختصاصی یا شخصی بدون رضایت خودداری کنید.
  • فیلترهای ایمنی: بسیاری از رابط های کاربری شامل فیلترهای محتوا هستند. مسئولانه پیکربندی کنید، به خصوص در تنظیمات تیمی.

یک گردش کار عملی و گام به گام که می توانید کپی کنید

  1. پایه را انتخاب کنید: SDXL پایه برای واقع گرایی؛ 1.5 برای سبک دار/انیمه.
  1. دستور را آماده کنید: یک دستور واضح 1-2 جمله ای به اضافه یک لیست منفی کوتاه بنویسید.
  1. پارامترها را تنظیم کنید: 1024×1024 (SDXL) یا 768×768 (1.5)، مراحل ~25، CFG 5-7 (SDXL) یا 7-9 (1.5).
  1. اگر ساختار مهم است (ژست/عمق/لبه ها)، ControlNet را اضافه کنید.
  1. با seed ثابت تست کنید. 4-8 نوع برای مقایسه تولید کنید.
  1. مورد علاقه خود را انتخاب کنید، سپس آن را اصلاح کنید: صفات نورپردازی را تغییر دهید، وزن LoRA را تنظیم کنید یا samplers را تغییر دهید.
  1. مقیاس را 1.5×–2× افزایش دهید. برای SDXL، Refiner را در 0.2-0.3 denoise اجرا کنید.
  1. لمس نهایی: مناطق مشکل را Inpaint کنید (دست ها، متن، اشیاء کوچک) و صادر کنید.

ابزار و جایی که Sider.AI در آن قرار می گیرد

شایان ذکر است: اگر در زمینه تحقیق، ایجاد انگیزه و تکرار کار می کنید، یک فضای کاری واحد کمک می کند. ابزاری مانند Sider.AI می تواند نسخه سازی سریع، مقایسه نسل ها در کنار هم و ذخیره تنظیمات از پیش تعیین شده (مدل پایه + LoRA ها + پشته های ControlNet) را ساده کند. این کار باعث صرفه جویی در وقت می شود و «تنظیمات مرموز» را کاهش می دهد. اگر همکاری می کنید، به دنبال ویژگی هایی مانند کتابخانه های سریع مشترک، سابقه اجرا و seeds سنجاق شده باشید تا هم تیمی ها بتوانند نتایج را دقیقاً بازتولید کنند.

نکات کلیدی

  • مدل های Stable Diffusion انعطاف پذیر، محلی پسند و بسیار قابل تنظیم برای تبدیل متن به تصویر هستند.
  • SDXL امروزه بهترین کیفیت مدل باز را ارائه می دهد. 1.5 هنوز برای هنر سبک دار و LoRA های انجمن می درخشد.
  • ControlNet ساختار را تضمین می کند. LoRA ها سبک را تزریق می کنند. ساده شروع کنید، در صورت نیاز کنترل را اضافه کنید.
  • سازگاری از seeds ثابت، CFG متوسط و تغییرات تدریجی ناشی می شود.
  • برای تولید، تنظیمات سند را ثبت کنید و از یک فضای کاری استفاده کنید که نسخه ها و پارامترها را ثبت می کند.

بعدش چی؟

  • SDXL را برای یک عکس فوتورئال امتحان کنید: یک مجموعه کوچک از تصاویر محصول را با زوایای کنترل شده از طریق ControlNet-Depth ایجاد کنید.
  • یک LoRA سبک بسازید: برای رمزگذاری ظاهر برند خود، روی 20-50 تصویر انتخاب شده تنظیم دقیق انجام دهید.
  • یک خط لوله قابل تکرار ایجاد کنید: seeds را قفل کنید، الگوهای سریع کوتاه بنویسید و تنظیمات را برای هر تحویل پیگیری کنید.

سوالات متداول

Q1: مدل های Stable Diffusion برای چه مواردی استفاده می شوند؟ مدل های Stable Diffusion تصاویری را از دستورات متنی برای هنر مفهومی، ماکت های محصول، پرتره ها، دارایی های بازاریابی و موارد دیگر تولید می کنند. آنها انعطاف پذیر هستند، به صورت محلی یا در ابر اجرا می شوند و از افزونه هایی مانند LoRA و ControlNet پشتیبانی می کنند.
Q2: کدام مدل Stable Diffusion را باید انتخاب کنم: SD 1.5، SD 2.1 یا SDXL؟ SDXL را برای بهترین کیفیت و واقع گرایی منبع باز انتخاب کنید، به خصوص برای محصولات و پرتره ها. SD 1.5 را برای هنر سبک دار یا انیمه به دلیل اکوسیستم LoRA گسترده آن انتخاب کنید. SD 2.1 یک حد وسط با conditioning تمیزتر است.
Q3: چگونه می توانم نتایج ثابتی از مدل های Stable Diffusion دریافت کنم؟ از یک seed ثابت، CFG متوسط (اغلب 5-7 برای SDXL) استفاده کنید و یک تنظیم را در یک زمان تغییر دهید. ControlNet ساختار را تضمین می کند، در حالی که LoRA ها سبک را بدون آموزش مجدد کل مدل اضافه می کنند.
Q4: تفاوت بین LoRA و ControlNet در Stable Diffusion چیست؟ LoRA سبک ها یا موضوعات جدید را از طریق یک آداپتور سبک وزن به یک مدل پایه آموزش می دهد، در حالی که ControlNet راهنمایی ساختاری مانند ژست، عمق یا لبه ها را ارائه می دهد. از آنها با هم برای خروجی های دقیق و شیک استفاده کنید.
Q5: چگونه می توانم کیفیت تصویر را از Stable Diffusion بهبود بخشم؟ رزولوشن را با دقت افزایش دهید (1.5×–2× در هر گذر)، از Refiner SDXL در denoise کم استفاده کنید و مناطق مشکل را inpaint کنید. دستورات را مختصر نگه دارید، اصطلاحات نورپردازی را متعادل کنید و چند سمپلر مانند DPM++ 2M را آزمایش کنید.

مقالات اخیر
تسلط بر GPT Image 2 Prompts با قابلیت Inpaint در Sider.AI

تسلط بر GPT Image 2 Prompts با قابلیت Inpaint در Sider.AI

GPT Image 2 در برابر Nano Banana Pro: کدام ابزار تصویر هوش مصنوعی برنده است؟

GPT Image 2 در برابر Nano Banana Pro: کدام ابزار تصویر هوش مصنوعی برنده است؟

چگونه از GPT Image 2 استفاده کنیم: راهنمای عملی با Sider.AI

چگونه از GPT Image 2 استفاده کنیم: راهنمای عملی با Sider.AI

تسلط بر GPT Image 2 Arena: راهنمای عملی با Sider.AI

تسلط بر GPT Image 2 Arena: راهنمای عملی با Sider.AI

ایده‌های عکاسی هایپررئال از غذا با Nano Banana Pro

ایده‌های عکاسی هایپررئال از غذا با Nano Banana Pro

Nano Banana Pro: راهنمای تولید دارایی‌های بازی ایزومتریک

Nano Banana Pro: راهنمای تولید دارایی‌های بازی ایزومتریک