چت
Claw
Code
Create
Wisebase
برنامه‌ها
قیمت‌گذاری
افزودن به Chrome
ورود
ورود
چت
Claw
Code
Create
Wisebase
برنامه‌ها
بازگشت به منوی اصلی
محصولات
برنامه‌ها
  • افزونه‌ها
  • iOS
  • Android
  • Mac OS
  • Windows
Wisebase
  • Wisebase
  • Deep Research
  • Scholar Research
  • Math Solver
  • Rec NoteNew
  • Audio To Text
  • Gamified Learning
  • Interactive Reading
  • ChatPDF
ابزارها
  • سازنده وبNew
  • اسلایدهای هوش مصنوعیNew
  • نویسنده مقاله هوش مصنوعی
  • Nano Banana Pro
  • Nano Banana Infographic
  • تولیدکننده تصویر هوش مصنوعی
  • ژنراتور اختلال ذهنی ایتالیایی
  • حذف‌کننده پس‌زمینه
  • تغییر دهنده پس‌زمینه
  • پاک‌کننده عکس
  • حذف‌کننده متن
  • نقاشی مجدد
  • ارتقاء دهنده تصویر
  • ایجاد
  • مترجم هوش مصنوعی
  • مترجم تصویر
  • مترجم PDF
Sider
  • تماس با ما
  • مرکز راهنما
  • دانلود
  • قیمت‌گذاری
  • برنامه آموزشی
  • چه چیز جدید است
  • وبلاگ
  • جامعه
  • شرکا
  • همکاری در فروش
©2026 تمام حقوق محفوظ است
شرایط استفاده
سیاست حفظ حریم خصوصی
  • صفحه اصلی
  • وبلاگ
  • ابزارهای هوش مصنوعی
  • بررسی قابلیت "استفاده از کامپیوتر" در Google Gemini 2.5: مرورگری که کلیک می‌کند

بررسی قابلیت "استفاده از کامپیوتر" در Google Gemini 2.5: مرورگری که کلیک می‌کند

به‌روزرسانی شده در 9 اکتبر 2025

10 دقیقه


آیا تا به حال آرزو کرده‌اید که می‌توانستید از خودتان یک کپی بسازید تا کارهای تکراری و خسته‌کننده را انجام دهد، در حالی که شما به بخش‌های جالب‌تر می‌پردازید؟ من چیزی شبیه به آن را امتحان کردم. اسمش Gemini 2.5 "Computer Use" گوگل است، و یک هوش مصنوعی است که فقط کلمات را نمی‌نویسد—بلکه واقعاً ماوس را حرکت می‌دهد، پیمایش می‌کند، در فیلدها تایپ می‌کند، و داخل یک پنجره مرورگر واقعی مانند یک دستیار بسیار کوشا و دقیق کار می‌کند. فکر کنید "کارآموزی که دستورالعمل‌ها را دقیقاً همانطور که نوشته شده دنبال می‌کند،" منهای استراحت‌های قهوه.
در این بررسی، من به شما نشان خواهم داد که Gemini 2.5 Computer Use چه کارهایی را به خوبی انجام می‌دهد، کجا دچار مشکل می‌شود، چگونه با سایر عوامل هوش مصنوعی مقایسه می‌شود، و اینکه آیا افراد عادی (نه فقط توسعه‌دهندگان) باید آن را امتحان کنند یا نه. در این مسیر، نکات عملی، چند نکته انحرافی، و مقداری چاشنی از شک و تردید سالم را اضافه خواهم کرد. کمربندها را ببندید.
Gemini 2.5 Computer Use واقعاً چیست؟
تصور کنید به یک دستیار می‌گویید، "مرورگر من را باز کن. به آن سایت هواپیمایی برو. روی Sign In کلیک کن. کد تأیید من را Paste کن. حالا فقط صندلی‌های کنار راهرو را فیلتر کن." این ترفند جادویی است: Gemini 2.5 Computer Use می‌تواند یک مرورگر را همان‌طور که شما انجام می‌دهید اداره کند—کلیک کردن روی دکمه‌ها، تایپ کردن در فرم‌ها، دنبال کردن برچسب‌های روی صفحه—به‌ویژه زمانی که هیچ API مرتبی برای دریافت داده‌ها یا فعال کردن عمل وجود ندارد. این یک عامل است که عمل می‌کند، نه فقط چت می‌کند. گوگل این را به عنوان یک مدل بهینه‌سازی‌شده برای وظایف وب (و به‌طور فزاینده‌ای، جریان‌های سبک موبایل) معرفی می‌کند، که به آن اجازه می‌دهد به اطلاعات دسترسی پیدا کند و کارهای روزمره را در جایی انجام دهد که بسیاری از برنامه‌ها "API-averse" هستند و همه چیز پشت JavaScript، کوکی‌ها و CAPTCHAها زندگی می‌کند.
خبر بزرگ: گوگل می‌گوید این طعم Computer Use از طریق API در دسترس است و به‌طور خاص برای مرورگرها و وظایف پیچیده UI تنظیم شده است. آزمایش‌کنندگان شخص ثالث عملکرد قوی در ارزیابی‌های مبتنی بر مرورگر گزارش کرده‌اند، در برخی موارد از رقبا در دقت، سرعت و حتی هزینه در برخی معیارهای ارزیابی پیشی گرفته است (البته ممکن است تجربه شما متفاوت باشد). پوشش مستقل همچنین اشاره می‌کند که هدف گوگل در ابتدا قابلیت اطمینان جریان وب بوده است، و برخی از نقاط قوت وظایف Android در معیارهای داخلی به سبک "AndroidWorld" ظاهر شده است.
چرا این موضوع مهم است (یک روز در زندگی)
بیایید اینترنت را به عنوان یک ساختمان اداری بزرگ و پردردسر تصور کنیم. APIها مانند همکاران صمیمی هستند که داده‌ها را به طور مرتب به شما تحویل می‌دهند. صفحات وب؟ آنها کابینت‌های قفل‌شده، کشوهای جیرجیرکننده و پاکت‌های محکم مهر و موم‌شده‌ای هستند که هنوز باید به طور فیزیکی باز کنید. Computer Use کارآموزی است که می‌تواند در راهرو قدم بزند، کابینت را باز کند و فرم را به درستی کپی کند—به آرامی، با دقت، یک کلیک در یک زمان.
اگر شما یک فریلنسر هستید که برگه‌های زمانی هفتگی را در یک پورتال پیچیده ارسال می‌کنید؛ یک محقق که یک فرم را در 20 سایت دولتی پر می‌کند؛ یک والد که از طریق پورتال آنلاین مدرسه کلیک می‌کند تا اطلاعات تماس اضطراری را به روز کند—این نوع کار طاقت‌فرسا است که می‌توانید به یک ربات دقیق و با ذهنیت تحت‌الفظی برون‌سپاری کنید.
نحوه استفاده از آن به این صورت است
  • راه‌اندازی: در دنیای توسعه‌دهندگان، شما مدل را از طریق API اجرا می‌کنید، دستورالعمل‌ها را ارائه می‌دهید، و محیط (یک مرورگر کنترل‌شده) را تعریف می‌کنید. پس از اجرای آن، شما عامل را با وظایف "prompt" می‌کنید. خواهید دید که صفحات را باز می‌کند، روی دکمه‌ها کلیک می‌کند و فیلدها را پر می‌کند. در سمت کاربر—اگر برنامه انتخابی شما آن را ادغام کند—چیزی شبیه به این دریافت خواهید کرد: "کاری را که می‌خواهید انجام شود شرح دهید،" سپس تماشا کنید که مکان‌نما شروع به کار می‌کند.
  • حس و حال: به یک دوچرخه‌سوار صبور فکر کنید، نه فرمول 1. مراحل عمدی و قابل مشاهده‌ای را برمی‌دارد. این می‌تواند اطمینان‌بخش باشد (شما دقیقاً می‌بینید که چه کار می‌کند) و همچنین در مقایسه با یک انسان که مانند یک سنجاب کافئین‌خورده کلیک می‌کند، کمی کند است. اما برای کارهای مداوم، تکراری و مستعد خطا؟ آهسته و پیوسته برنده می‌شود.
  • حصارها: سرکش نخواهد شد. این عوامل به شدت sandboxed شده‌اند و توسط فیلترهای محتوا و ایمنی محدود شده‌اند، به ویژه در زمینه‌های سازمانی از طریق Vertex AI. آنها در مورد اقدامات حساس محتاط هستند و دستورالعمل‌های واضح را به "حس و حال" ترجیح می‌دهند. اگر مبهم باشید، درخواست توضیح می‌کند.
در چه زمینه‌هایی خوب است
  • فرم پر کردن در سایت‌های سرسخت: هر چیزی که فاقد API مناسب است اما دارای برچسب‌های سازگار است، قلمرو اصلی است.
  • وظایف چند مرحله‌ای وب: ورود به سیستم (در زمینه‌های مجاز)، پیمایش در منوهای تو در تو، فیلتر کردن نتایج، صادر کردن CSVها، و بارگذاری یا دانلود فایل‌ها—اگر UI سایت پایدار باشد.
  • کارهای تکراری: گردش کارهای هفتگی، تغییر نام دسته‌ای از طریق UIهای وب، فهرست کردن موارد، بیرون کشیدن داده‌ها از داشبوردهایی که مجاز به مشاهده آنها هستید.
  • دنباله‌های طولانی و خسته‌کننده: نوعی چیزی که باعث می‌شود شما از خودتان بی‌خود شوید. عامل از خود بی‌خود نمی‌شود.
در چه زمینه‌هایی مشکل دارد
  • موانع CAPTCHAها و MFA: شما همچنان فرد بالغ در اتاق برای لحظات "ثابت کنید که انسان هستید" خواهید بود.
  • تغییرات UI: اگر متن دکمه یا طرح‌بندی یک سایت تغییر کند، ممکن است عامل به یک تلنگر یا یک re-prompt نیاز داشته باشد.
  • شیاطین سرعت: یک انسان سریع گاهی اوقات می‌تواند یک فرم را سریع‌تر پر کند. برد در اینجا سازگاری و عدم غر زدن است.
  • Promptهای مبهم: "موارد خوب را برای من پیدا کن" یک برنامه نیست. معیارها را مشخص کنید.
در مقایسه با رقابت
  • در مقابل مدل‌های چت سنتی (فقط متن): Computer Use با اقدام مستقیم در مرورگر، یک خط در شن و ماسه می‌کشد. فقط به شما نمی‌گوید چگونه این کار را انجام دهید؛ آن را انجام می‌دهد.
  • در مقابل سایر مدل‌های عامل: گزارش‌ها و آزمایش‌های اولیه نشان می‌دهند که Gemini 2.5 Computer Use به شدت در وظایف مرورگر واقعی رقابت می‌کند و به عنوان بهینه‌سازی‌شده برای تعاملات وب معرفی می‌شود. پوشش رسانه‌های فناوری تأیید می‌کند که "از یک مرورگر وب مانند شما استفاده می‌کند" و بر تمرکز بر ناوبری UI در دنیای واقعی تأکید می‌کند. برخی از سازمان‌های معیارگیری شخص ثالث می‌گویند که در تنظیمات خود از نظر دقت و سرعت پیشی گرفته است، اگرچه، مانند همیشه، معیارها مانند طالع‌بینی هستند—سرگرم‌کننده، گاهی اوقات دقیق، جایگزینی برای آزمایش‌های خودتان نیست.
  • وب در مقابل Android: گزارش‌دهی عمومی آن را در درجه اول به عنوان بهینه‌سازی‌شده برای وب، با قابلیت وظایف Android امیدوارکننده در حال ظهور در آزمایش‌ها، معرفی می‌کند. اگر رویای اجرای کل تلفن خود را به صورت خلبان اتوماتیک می‌بینید، انتظارات را کاهش دهید—فعلاً.
یک داستان کوتاه: تغییر پرواز
من به آن یک سردرد کلاسیک دادم: "Airline X را باز کن. وارد سیستم شو. سفرهای آینده من را بیرون بکش. پرواز برگشت را به شنبه تغییر بده. یک صندلی کنار راهرو انتخاب کن. مایل‌ها را اعمال کن. تأیید کن که آیا هزینه زیر 100 دلار است؛ اگر نه، متوقف شو و گزارش بده." تماشای آن مانند آموزش یک دستیار جدید بود. به سایت رفت، "My Trips" را پیدا کرد، شماره تأیید صحیح را پیدا کرد، و… در نمودار صندلی مکث کرد. برچسب‌ها کاملاً استاندارد نبودند. درخواست توضیح کرد: "صندلی‌های کنار راهرو با 'A' مشخص شده‌اند، تأیید می‌کنید؟" من تأیید کردم. ادامه داد—و من را به صفحه بررسی رساند. هزینه 149 دلار بود. طبق دستورالعمل متوقف شد، هزینه تغییر را خلاصه کرد، و کنترل را به من بازگرداند. کاملاً جادویی نیست. بسیار مفید است.
حریم خصوصی و ایمنی
اسناد رسمی گوگل و مسیرهای سازمانی بر فیلترهای ایمنی و محتوای قابل تنظیم تأکید دارند—اساساً سوئیچ‌های "روی دکمه قرمز کلیک نکنید" که بخش‌های IT دوست دارند. عامل در یک محیط کنترل‌شده اجرا می‌شود، و شما می‌توانید آنچه را که می‌تواند ببیند یا انجام دهد محدود کنید. با این حال: کلیدهای کل پادشاهی دیجیتال خود را به هیچ عاملی ندهید. یک سازش عملی، تعیین محدوده اعتبارنامه‌ها (یک کار، یک حساب)، استفاده از ورودهای یک‌بارمصرف یا کمترین امتیاز برای کارهای پرخطر، و درخواست از عامل برای نشان دادن کار خود قبل از کلیک کردن روی "تأیید" است.
دسترسی و دسترسی‌پذیری
گوگل می‌گوید Gemini 2.5 Computer Use از طریق API در دسترس است، با تمرکز بر توسعه‌دهندگان و پلتفرم‌هایی که می‌خواهند این قدرت "انجام کارها در یک مرورگر" را در برنامه‌های خود جاسازی کنند. دسترسی رو به مصرف‌کننده به این بستگی دارد که چه کسی آن را ادغام می‌کند—به ابزارهای بهره‌وری، خدمات RPA-مانند، یا نوارهای کناری هوش مصنوعی فکر کنید که می‌توانند با خیال راحت یک جلسه مرورگر را از طرف شما باز کنند.
سرعت دنیای واقعی: چقدر سریع است؟
اگر هوس رضایت فوری دارید، این را بدانید: مانند یک کارآموز دقیق رفتار می‌کند. هر مرحله قابل مشاهده و قابل تأیید است، که بخشی از هدف است. این کمتر در مورد تراشیدن میلی‌ثانیه‌ها و بیشتر در مورد بستن شکاف "بدون API، بدون مشکل" است. در گردش کارهای طولانی‌تر، ثبات به یک ابرقدرت تبدیل می‌شود. خطاهای کمتر. کار مجدد کمتر. و برخلاف من، هرگز برای بررسی آب و هوا به زبانه دیگری نمی‌رود.
نکاتی برای بهترین نتایج
  • صریح باشید: دستورالعمل‌های گام به گام، معیارهای موفقیت، و کاری که باید در صورت وقوع اتفاق غیرمنتظره انجام دهید (به عنوان مثال، "اگر هزینه از 100 دلار بیشتر شد، متوقف شوید و خلاصه کنید") را ارائه دهید.
  • از سایت‌های پایدار استفاده کنید: اگر طرح‌بندی یک سایت روزانه تغییر می‌کند، وقت خود را صرف re-prompting خواهید کرد. با UIهای سازگار شروع کنید.
  • اعتبارنامه‌ها را محدود کنید: با حساب‌های کمترین امتیاز خطر را به حداقل برسانید و پس از انجام وظایف، نشانه‌ها را لغو کنید.
  • درخواست پیش‌نمایش کنید: از آن بخواهید قبل از تعهد به اقدامات غیرقابل برگشت، مراحل را خلاصه کند یا عکس بگیرد.
  • تکرار کنید: با promptها مانند یک دستور غذا رفتار کنید. مواد را تغییر دهید، دوباره بپزید.
چه کسی باید آن را امتحان کند
  • افراد عملیاتی غرق در پورتال‌ها: اگر شغل شما "انجام همان 28 کلیک در 12 سایت فروشنده" است، این درمان است.
  • تیم‌های کوچک بدون منابع مهندسی: بدون API؟ مشکلی نیست. اجازه دهید عامل مرورگر را هدایت کند.
  • کاربران قدرتمند و سازندگان RPA: اگر از اتوماسیون فرآیند رباتیک استفاده کرده‌اید، این مانند RPA است که صفحه را به زبان طبیعی "می‌خواند".
به کجا می‌تواند بعداً برود
  • انعطاف‌پذیری بهتر: راه‌های هوشمندانه‌تر برای سازگاری در هنگام تغییر صفحه.
  • بازیابی هوشمندانه‌تر خطا: "اگر این modal ظاهر شد، مسیر B را امتحان کنید؛ اگر ورود به سیستم ناموفق بود، از کاربر MFA بخواهید."
  • جریان‌های ترکیبی API + UI: در صورت وجود از APIها استفاده کنید، در صورت عدم وجود به UI برگردید. بهترین از هر دو جهان.
درباره آن زاویه "Sider.AI"
اگر در مرورگر خود زندگی می‌کنید، یک نوار کناری هوش مصنوعی که می‌تواند با چندین مدل صحبت کند و گهگاه در صفحه عمل کند، شروع به احساس بهترین زبانه ارتش سوئیس در جهان می‌کند. Sider.AI دقیقاً در آن محله قرار دارد: این یک نوار کناری هوش مصنوعی محبوب است که مدل‌های پیشرو را ادغام می‌کند و به شما کمک می‌کند مستقیماً در صفحه‌ای که در حال حاضر می‌خوانید کار کنید. و یک راهنمای گام به گام ساده و به زبان ساده در مورد اینکه Gemini 2.5 Computer Use در عمل چگونه احساس می‌شود وجود دارد—همراه با یادآوری اینکه بیشتر شبیه یک دوچرخه‌سوار قانونمند عمل می‌کند تا یک مسابقه‌دهنده سرعت. اگر کنجکاو هستید که چگونه این ممکن است در مرور روزمره شما جای بگیرد، این یک در دستی است.
مزایا و معایب در یک نگاه
مزایا
  • می‌تواند اقدامات واقعی مرورگر را سرتاسر انجام دهد
  • در کارهای تکراری و چند مرحله‌ای در سایت‌های سرسخت قوی است
  • رفتار گام به گام شفاف و قابل ممیزی
  • کنترل‌های ایمنی برای زمینه‌های سازمانی
معایب
  • کندتر از یک انسان سریع در انفجارهای کوتاه
  • CAPTCHAها/MFA هنوز به شما نیاز دارند
  • حساس به تغییرات UI و promptهای مبهم
  • نیاز به محدود کردن دقیق مجوزها دارد
حکم
Gemini 2.5 Computer Use یک ربات پر زرق و برق "تماشا کنید که شغلم را انجام می‌دهد" نیست. این یک کمک‌کننده دقیق و قابل اعتماد برای کارهای خسته‌کننده مرورگر است که از آن متنفر هستید. وقتی کار طولانی، تکراری و به خوبی تعریف شده باشد، می‌درخشد. هنگامی که کار مبهم، پر از پاپ‌آپ‌های غافلگیرکننده یا مسدود شده توسط CAPTCHAها باشد، همچنان باید در کنار آن سوار شوید.
اگر روز کاری شما 20٪ فکر کردن و 80٪ کلیک کردن در وب‌سایت‌های دست و پا گیر است، این لحظه شماست. این کار طاقت‌فرسا را به یک چک‌لیست تبدیل کنید که ربات می‌تواند از آن پیروی کند. بگذارید دوچرخه‌سواری باشد که از هر تابلوی ایست پیروی می‌کند در حالی که شما تصمیم می‌گیرید که واقعاً می‌خواهید به کجا بروید.
و یک نکته آخر…
به خود آینده خود هدیه دهید: promptها را مانند کارت دستور غذا برای یک نوجوان که آشپزی یاد می‌گیرد بنویسید. "تا 350 گرم کنید. اگر فر دود کرد، آن را خاموش کنید." هرچه با Gemini 2.5 Computer Use واضح‌تر باشید، در پختن کارهای وب شما به کمال بهتر می‌شود—بدون نیاز به کپسول آتش‌نشانی.
منابع و مطالعه بیشتر
  • اعلامیه گوگل از مدل Gemini 2.5 Computer Use.
  • بررسی The Verge در مورد نحوه عملکرد آن در یک پنجره مرورگر واقعی.
  • پوشش اولیه بهینه‌سازی اول وب و قدرت وظایف Android.
  • یادداشت‌های معیارگیری شخص ثالث در مورد عملکرد عامل مرورگر.
  • پیکربندی فیلتر ایمنی و محتوای Vertex AI برای شرکت.
  • صفحه اصلی Sider.AI و توضیح عملی پر کردن فرم.

سؤالات متداول

Q1: آیا Google Gemini 2.5 Computer Use واقعاً سریعتر از یک انسان است؟ معمولاً در کارهای کوتاه نه. ارزش در قابلیت اطمینان و استقامت است—در جریان‌های طولانی و تکراری، سرعت ثابت عامل و نرخ خطای پایین می‌تواند یک انسان عجول را شکست دهد، به خصوص وقتی خستگی صفر و یادآوری کامل را در نظر بگیرید.
Q2: چه نوع وظایفی برای Gemini 2.5 Computer Use بهترین هستند؟ هر چیزی که در یک مرورگر وب تکراری باشد: پر کردن فرم چند فیلدی، فیلتر کردن داشبورد، دانلود گزارش‌ها یا آپلود فایل‌ها. زمانی ایده‌آل است که API وجود نداشته باشد و طرح‌بندی سایت نسبتاً پایدار باشد.
Q3: Gemini 2.5 Computer Use در مقایسه با سایر عوامل هوش مصنوعی چگونه است؟ پوشش نشان می‌دهد که برای وظایف مرورگر بهینه‌سازی شده است و در ارزیابی‌های شخص ثالث عملکرد رقابتی دارد. مانند همیشه، در گردش کارهای واقعی خود آزمایش کنید—معیارها مفید هستند، اما سایت‌ها و موارد حاشیه‌ای شما داور واقعی هستند.
Q4: آیا CAPTCHAها یا احراز هویت چند عاملی را برای من انجام می‌دهد؟ نه. انتظار داشته باشید برای چالش‌های CAPTCHA و MFA وارد عمل شوید. یک راه‌اندازی عملی این است که عامل را در آن مراحل متوقف کنید، تأیید را تکمیل کنید، سپس اجازه دهید به کار خود ادامه دهد.
Q5: آیا Gemini 2.5 Computer Use برای حساب‌های حساس ایمن است؟ می‌تواند باشد، با حفاظ‌ها. از اعتبارنامه‌های کمترین امتیاز استفاده کنید، دسترسی را به شدت محدود کنید، و فیلترهای ایمنی و محتوا را فعال کنید—به ویژه در محیط‌های سازمانی. از عامل بخواهید قبل از تعهد به اقدامات پرخطر، مراحل را پیش‌نمایش یا توضیح دهد.

مقالات اخیر
چگونه در ChatPDF مهارت پیدا کنیم: دسترسی سریع‌تر به اطلاعات از اسناد حجیم

چگونه در ChatPDF مهارت پیدا کنیم: دسترسی سریع‌تر به اطلاعات از اسناد حجیم

بهترین جایگزین X Auto-Translation برای ترجمه سریع و دقیق اسناد

بهترین جایگزین X Auto-Translation برای ترجمه سریع و دقیق اسناد

عدم دسترسی به ترجمه هوش مصنوعی سامسونگ در ایران؟ راهکارهای عملی

عدم دسترسی به ترجمه هوش مصنوعی سامسونگ در ایران؟ راهکارهای عملی

ابزارهای ترجمه فارسی: راهنمای عملی برای کار سریع‌تر و دقیق‌تر

ابزارهای ترجمه فارسی: راهنمای عملی برای کار سریع‌تر و دقیق‌تر

بهترین جایگزین Grok برای تحقیقات عمیق و مستند

بهترین جایگزین Grok برای تحقیقات عمیق و مستند

۱۵ ویژگی برتر تولیدکننده تصویر هوش مصنوعی که واقعاً از آنها استفاده خواهید کرد

۱۵ ویژگی برتر تولیدکننده تصویر هوش مصنوعی که واقعاً از آنها استفاده خواهید کرد