آیا تا به حال آرزو کردهاید که میتوانستید از خودتان یک کپی بسازید تا کارهای تکراری و خستهکننده را انجام دهد، در حالی که شما به بخشهای جالبتر میپردازید؟ من چیزی شبیه به آن را امتحان کردم. اسمش Gemini 2.5 "Computer Use" گوگل است، و یک هوش مصنوعی است که فقط کلمات را نمینویسد—بلکه واقعاً ماوس را حرکت میدهد، پیمایش میکند، در فیلدها تایپ میکند، و داخل یک پنجره مرورگر واقعی مانند یک دستیار بسیار کوشا و دقیق کار میکند. فکر کنید "کارآموزی که دستورالعملها را دقیقاً همانطور که نوشته شده دنبال میکند،" منهای استراحتهای قهوه.
در این بررسی، من به شما نشان خواهم داد که Gemini 2.5 Computer Use چه کارهایی را به خوبی انجام میدهد، کجا دچار مشکل میشود، چگونه با سایر عوامل هوش مصنوعی مقایسه میشود، و اینکه آیا افراد عادی (نه فقط توسعهدهندگان) باید آن را امتحان کنند یا نه. در این مسیر، نکات عملی، چند نکته انحرافی، و مقداری چاشنی از شک و تردید سالم را اضافه خواهم کرد. کمربندها را ببندید.
Gemini 2.5 Computer Use واقعاً چیست؟
تصور کنید به یک دستیار میگویید، "مرورگر من را باز کن. به آن سایت هواپیمایی برو. روی Sign In کلیک کن. کد تأیید من را Paste کن. حالا فقط صندلیهای کنار راهرو را فیلتر کن." این ترفند جادویی است: Gemini 2.5 Computer Use میتواند یک مرورگر را همانطور که شما انجام میدهید اداره کند—کلیک کردن روی دکمهها، تایپ کردن در فرمها، دنبال کردن برچسبهای روی صفحه—بهویژه زمانی که هیچ API مرتبی برای دریافت دادهها یا فعال کردن عمل وجود ندارد. این یک عامل است که عمل میکند، نه فقط چت میکند. گوگل این را به عنوان یک مدل بهینهسازیشده برای وظایف وب (و بهطور فزایندهای، جریانهای سبک موبایل) معرفی میکند، که به آن اجازه میدهد به اطلاعات دسترسی پیدا کند و کارهای روزمره را در جایی انجام دهد که بسیاری از برنامهها "API-averse" هستند و همه چیز پشت JavaScript، کوکیها و CAPTCHAها زندگی میکند.
خبر بزرگ: گوگل میگوید این طعم Computer Use از طریق API در دسترس است و بهطور خاص برای مرورگرها و وظایف پیچیده UI تنظیم شده است. آزمایشکنندگان شخص ثالث عملکرد قوی در ارزیابیهای مبتنی بر مرورگر گزارش کردهاند، در برخی موارد از رقبا در دقت، سرعت و حتی هزینه در برخی معیارهای ارزیابی پیشی گرفته است (البته ممکن است تجربه شما متفاوت باشد). پوشش مستقل همچنین اشاره میکند که هدف گوگل در ابتدا قابلیت اطمینان جریان وب بوده است، و برخی از نقاط قوت وظایف Android در معیارهای داخلی به سبک "AndroidWorld" ظاهر شده است.
چرا این موضوع مهم است (یک روز در زندگی)
بیایید اینترنت را به عنوان یک ساختمان اداری بزرگ و پردردسر تصور کنیم. APIها مانند همکاران صمیمی هستند که دادهها را به طور مرتب به شما تحویل میدهند. صفحات وب؟ آنها کابینتهای قفلشده، کشوهای جیرجیرکننده و پاکتهای محکم مهر و مومشدهای هستند که هنوز باید به طور فیزیکی باز کنید. Computer Use کارآموزی است که میتواند در راهرو قدم بزند، کابینت را باز کند و فرم را به درستی کپی کند—به آرامی، با دقت، یک کلیک در یک زمان.
اگر شما یک فریلنسر هستید که برگههای زمانی هفتگی را در یک پورتال پیچیده ارسال میکنید؛ یک محقق که یک فرم را در 20 سایت دولتی پر میکند؛ یک والد که از طریق پورتال آنلاین مدرسه کلیک میکند تا اطلاعات تماس اضطراری را به روز کند—این نوع کار طاقتفرسا است که میتوانید به یک ربات دقیق و با ذهنیت تحتالفظی برونسپاری کنید.
نحوه استفاده از آن به این صورت است
- راهاندازی: در دنیای توسعهدهندگان، شما مدل را از طریق API اجرا میکنید، دستورالعملها را ارائه میدهید، و محیط (یک مرورگر کنترلشده) را تعریف میکنید. پس از اجرای آن، شما عامل را با وظایف "prompt" میکنید. خواهید دید که صفحات را باز میکند، روی دکمهها کلیک میکند و فیلدها را پر میکند. در سمت کاربر—اگر برنامه انتخابی شما آن را ادغام کند—چیزی شبیه به این دریافت خواهید کرد: "کاری را که میخواهید انجام شود شرح دهید،" سپس تماشا کنید که مکاننما شروع به کار میکند.
- حس و حال: به یک دوچرخهسوار صبور فکر کنید، نه فرمول 1. مراحل عمدی و قابل مشاهدهای را برمیدارد. این میتواند اطمینانبخش باشد (شما دقیقاً میبینید که چه کار میکند) و همچنین در مقایسه با یک انسان که مانند یک سنجاب کافئینخورده کلیک میکند، کمی کند است. اما برای کارهای مداوم، تکراری و مستعد خطا؟ آهسته و پیوسته برنده میشود.
- حصارها: سرکش نخواهد شد. این عوامل به شدت sandboxed شدهاند و توسط فیلترهای محتوا و ایمنی محدود شدهاند، به ویژه در زمینههای سازمانی از طریق Vertex AI. آنها در مورد اقدامات حساس محتاط هستند و دستورالعملهای واضح را به "حس و حال" ترجیح میدهند. اگر مبهم باشید، درخواست توضیح میکند.
در چه زمینههایی خوب است
- فرم پر کردن در سایتهای سرسخت: هر چیزی که فاقد API مناسب است اما دارای برچسبهای سازگار است، قلمرو اصلی است.
- وظایف چند مرحلهای وب: ورود به سیستم (در زمینههای مجاز)، پیمایش در منوهای تو در تو، فیلتر کردن نتایج، صادر کردن CSVها، و بارگذاری یا دانلود فایلها—اگر UI سایت پایدار باشد.
- کارهای تکراری: گردش کارهای هفتگی، تغییر نام دستهای از طریق UIهای وب، فهرست کردن موارد، بیرون کشیدن دادهها از داشبوردهایی که مجاز به مشاهده آنها هستید.
- دنبالههای طولانی و خستهکننده: نوعی چیزی که باعث میشود شما از خودتان بیخود شوید. عامل از خود بیخود نمیشود.
در چه زمینههایی مشکل دارد
- موانع CAPTCHAها و MFA: شما همچنان فرد بالغ در اتاق برای لحظات "ثابت کنید که انسان هستید" خواهید بود.
- تغییرات UI: اگر متن دکمه یا طرحبندی یک سایت تغییر کند، ممکن است عامل به یک تلنگر یا یک re-prompt نیاز داشته باشد.
- شیاطین سرعت: یک انسان سریع گاهی اوقات میتواند یک فرم را سریعتر پر کند. برد در اینجا سازگاری و عدم غر زدن است.
- Promptهای مبهم: "موارد خوب را برای من پیدا کن" یک برنامه نیست. معیارها را مشخص کنید.
در مقایسه با رقابت
- در مقابل مدلهای چت سنتی (فقط متن): Computer Use با اقدام مستقیم در مرورگر، یک خط در شن و ماسه میکشد. فقط به شما نمیگوید چگونه این کار را انجام دهید؛ آن را انجام میدهد.
- در مقابل سایر مدلهای عامل: گزارشها و آزمایشهای اولیه نشان میدهند که Gemini 2.5 Computer Use به شدت در وظایف مرورگر واقعی رقابت میکند و به عنوان بهینهسازیشده برای تعاملات وب معرفی میشود. پوشش رسانههای فناوری تأیید میکند که "از یک مرورگر وب مانند شما استفاده میکند" و بر تمرکز بر ناوبری UI در دنیای واقعی تأکید میکند. برخی از سازمانهای معیارگیری شخص ثالث میگویند که در تنظیمات خود از نظر دقت و سرعت پیشی گرفته است، اگرچه، مانند همیشه، معیارها مانند طالعبینی هستند—سرگرمکننده، گاهی اوقات دقیق، جایگزینی برای آزمایشهای خودتان نیست.
- وب در مقابل Android: گزارشدهی عمومی آن را در درجه اول به عنوان بهینهسازیشده برای وب، با قابلیت وظایف Android امیدوارکننده در حال ظهور در آزمایشها، معرفی میکند. اگر رویای اجرای کل تلفن خود را به صورت خلبان اتوماتیک میبینید، انتظارات را کاهش دهید—فعلاً.
یک داستان کوتاه: تغییر پرواز
من به آن یک سردرد کلاسیک دادم: "Airline X را باز کن. وارد سیستم شو. سفرهای آینده من را بیرون بکش. پرواز برگشت را به شنبه تغییر بده. یک صندلی کنار راهرو انتخاب کن. مایلها را اعمال کن. تأیید کن که آیا هزینه زیر 100 دلار است؛ اگر نه، متوقف شو و گزارش بده." تماشای آن مانند آموزش یک دستیار جدید بود. به سایت رفت، "My Trips" را پیدا کرد، شماره تأیید صحیح را پیدا کرد، و… در نمودار صندلی مکث کرد. برچسبها کاملاً استاندارد نبودند. درخواست توضیح کرد: "صندلیهای کنار راهرو با 'A' مشخص شدهاند، تأیید میکنید؟" من تأیید کردم. ادامه داد—و من را به صفحه بررسی رساند. هزینه 149 دلار بود. طبق دستورالعمل متوقف شد، هزینه تغییر را خلاصه کرد، و کنترل را به من بازگرداند. کاملاً جادویی نیست. بسیار مفید است.
حریم خصوصی و ایمنی
اسناد رسمی گوگل و مسیرهای سازمانی بر فیلترهای ایمنی و محتوای قابل تنظیم تأکید دارند—اساساً سوئیچهای "روی دکمه قرمز کلیک نکنید" که بخشهای IT دوست دارند. عامل در یک محیط کنترلشده اجرا میشود، و شما میتوانید آنچه را که میتواند ببیند یا انجام دهد محدود کنید. با این حال: کلیدهای کل پادشاهی دیجیتال خود را به هیچ عاملی ندهید. یک سازش عملی، تعیین محدوده اعتبارنامهها (یک کار، یک حساب)، استفاده از ورودهای یکبارمصرف یا کمترین امتیاز برای کارهای پرخطر، و درخواست از عامل برای نشان دادن کار خود قبل از کلیک کردن روی "تأیید" است.
دسترسی و دسترسیپذیری
گوگل میگوید Gemini 2.5 Computer Use از طریق API در دسترس است، با تمرکز بر توسعهدهندگان و پلتفرمهایی که میخواهند این قدرت "انجام کارها در یک مرورگر" را در برنامههای خود جاسازی کنند. دسترسی رو به مصرفکننده به این بستگی دارد که چه کسی آن را ادغام میکند—به ابزارهای بهرهوری، خدمات RPA-مانند، یا نوارهای کناری هوش مصنوعی فکر کنید که میتوانند با خیال راحت یک جلسه مرورگر را از طرف شما باز کنند.
سرعت دنیای واقعی: چقدر سریع است؟
اگر هوس رضایت فوری دارید، این را بدانید: مانند یک کارآموز دقیق رفتار میکند. هر مرحله قابل مشاهده و قابل تأیید است، که بخشی از هدف است. این کمتر در مورد تراشیدن میلیثانیهها و بیشتر در مورد بستن شکاف "بدون API، بدون مشکل" است. در گردش کارهای طولانیتر، ثبات به یک ابرقدرت تبدیل میشود. خطاهای کمتر. کار مجدد کمتر. و برخلاف من، هرگز برای بررسی آب و هوا به زبانه دیگری نمیرود.
نکاتی برای بهترین نتایج
- صریح باشید: دستورالعملهای گام به گام، معیارهای موفقیت، و کاری که باید در صورت وقوع اتفاق غیرمنتظره انجام دهید (به عنوان مثال، "اگر هزینه از 100 دلار بیشتر شد، متوقف شوید و خلاصه کنید") را ارائه دهید.
- از سایتهای پایدار استفاده کنید: اگر طرحبندی یک سایت روزانه تغییر میکند، وقت خود را صرف re-prompting خواهید کرد. با UIهای سازگار شروع کنید.
- اعتبارنامهها را محدود کنید: با حسابهای کمترین امتیاز خطر را به حداقل برسانید و پس از انجام وظایف، نشانهها را لغو کنید.
- درخواست پیشنمایش کنید: از آن بخواهید قبل از تعهد به اقدامات غیرقابل برگشت، مراحل را خلاصه کند یا عکس بگیرد.
- تکرار کنید: با promptها مانند یک دستور غذا رفتار کنید. مواد را تغییر دهید، دوباره بپزید.
چه کسی باید آن را امتحان کند
- افراد عملیاتی غرق در پورتالها: اگر شغل شما "انجام همان 28 کلیک در 12 سایت فروشنده" است، این درمان است.
- تیمهای کوچک بدون منابع مهندسی: بدون API؟ مشکلی نیست. اجازه دهید عامل مرورگر را هدایت کند.
- کاربران قدرتمند و سازندگان RPA: اگر از اتوماسیون فرآیند رباتیک استفاده کردهاید، این مانند RPA است که صفحه را به زبان طبیعی "میخواند".
به کجا میتواند بعداً برود
- انعطافپذیری بهتر: راههای هوشمندانهتر برای سازگاری در هنگام تغییر صفحه.
- بازیابی هوشمندانهتر خطا: "اگر این modal ظاهر شد، مسیر B را امتحان کنید؛ اگر ورود به سیستم ناموفق بود، از کاربر MFA بخواهید."
- جریانهای ترکیبی API + UI: در صورت وجود از APIها استفاده کنید، در صورت عدم وجود به UI برگردید. بهترین از هر دو جهان.
اگر در مرورگر خود زندگی میکنید، یک نوار کناری هوش مصنوعی که میتواند با چندین مدل صحبت کند و گهگاه در صفحه عمل کند، شروع به احساس بهترین زبانه ارتش سوئیس در جهان میکند. Sider.AI دقیقاً در آن محله قرار دارد: این یک نوار کناری هوش مصنوعی محبوب است که مدلهای پیشرو را ادغام میکند و به شما کمک میکند مستقیماً در صفحهای که در حال حاضر میخوانید کار کنید. و یک راهنمای گام به گام ساده و به زبان ساده در مورد اینکه Gemini 2.5 Computer Use در عمل چگونه احساس میشود وجود دارد—همراه با یادآوری اینکه بیشتر شبیه یک دوچرخهسوار قانونمند عمل میکند تا یک مسابقهدهنده سرعت. اگر کنجکاو هستید که چگونه این ممکن است در مرور روزمره شما جای بگیرد، این یک در دستی است. مزایا و معایب در یک نگاه
مزایا
- میتواند اقدامات واقعی مرورگر را سرتاسر انجام دهد
- در کارهای تکراری و چند مرحلهای در سایتهای سرسخت قوی است
- رفتار گام به گام شفاف و قابل ممیزی
- کنترلهای ایمنی برای زمینههای سازمانی
معایب
- کندتر از یک انسان سریع در انفجارهای کوتاه
- CAPTCHAها/MFA هنوز به شما نیاز دارند
- حساس به تغییرات UI و promptهای مبهم
- نیاز به محدود کردن دقیق مجوزها دارد
حکم
Gemini 2.5 Computer Use یک ربات پر زرق و برق "تماشا کنید که شغلم را انجام میدهد" نیست. این یک کمککننده دقیق و قابل اعتماد برای کارهای خستهکننده مرورگر است که از آن متنفر هستید. وقتی کار طولانی، تکراری و به خوبی تعریف شده باشد، میدرخشد. هنگامی که کار مبهم، پر از پاپآپهای غافلگیرکننده یا مسدود شده توسط CAPTCHAها باشد، همچنان باید در کنار آن سوار شوید.
اگر روز کاری شما 20٪ فکر کردن و 80٪ کلیک کردن در وبسایتهای دست و پا گیر است، این لحظه شماست. این کار طاقتفرسا را به یک چکلیست تبدیل کنید که ربات میتواند از آن پیروی کند. بگذارید دوچرخهسواری باشد که از هر تابلوی ایست پیروی میکند در حالی که شما تصمیم میگیرید که واقعاً میخواهید به کجا بروید.
و یک نکته آخر…
به خود آینده خود هدیه دهید: promptها را مانند کارت دستور غذا برای یک نوجوان که آشپزی یاد میگیرد بنویسید. "تا 350 گرم کنید. اگر فر دود کرد، آن را خاموش کنید." هرچه با Gemini 2.5 Computer Use واضحتر باشید، در پختن کارهای وب شما به کمال بهتر میشود—بدون نیاز به کپسول آتشنشانی.
منابع و مطالعه بیشتر
- اعلامیه گوگل از مدل Gemini 2.5 Computer Use.
- بررسی The Verge در مورد نحوه عملکرد آن در یک پنجره مرورگر واقعی.
- پوشش اولیه بهینهسازی اول وب و قدرت وظایف Android.
- یادداشتهای معیارگیری شخص ثالث در مورد عملکرد عامل مرورگر.
- پیکربندی فیلتر ایمنی و محتوای Vertex AI برای شرکت.
- صفحه اصلی Sider.AI و توضیح عملی پر کردن فرم.
سؤالات متداول
Q1: آیا Google Gemini 2.5 Computer Use واقعاً سریعتر از یک انسان است؟
معمولاً در کارهای کوتاه نه. ارزش در قابلیت اطمینان و استقامت است—در جریانهای طولانی و تکراری، سرعت ثابت عامل و نرخ خطای پایین میتواند یک انسان عجول را شکست دهد، به خصوص وقتی خستگی صفر و یادآوری کامل را در نظر بگیرید.
Q2: چه نوع وظایفی برای Gemini 2.5 Computer Use بهترین هستند؟
هر چیزی که در یک مرورگر وب تکراری باشد: پر کردن فرم چند فیلدی، فیلتر کردن داشبورد، دانلود گزارشها یا آپلود فایلها. زمانی ایدهآل است که API وجود نداشته باشد و طرحبندی سایت نسبتاً پایدار باشد.
Q3: Gemini 2.5 Computer Use در مقایسه با سایر عوامل هوش مصنوعی چگونه است؟
پوشش نشان میدهد که برای وظایف مرورگر بهینهسازی شده است و در ارزیابیهای شخص ثالث عملکرد رقابتی دارد. مانند همیشه، در گردش کارهای واقعی خود آزمایش کنید—معیارها مفید هستند، اما سایتها و موارد حاشیهای شما داور واقعی هستند.
Q4: آیا CAPTCHAها یا احراز هویت چند عاملی را برای من انجام میدهد؟
نه. انتظار داشته باشید برای چالشهای CAPTCHA و MFA وارد عمل شوید. یک راهاندازی عملی این است که عامل را در آن مراحل متوقف کنید، تأیید را تکمیل کنید، سپس اجازه دهید به کار خود ادامه دهد.
Q5: آیا Gemini 2.5 Computer Use برای حسابهای حساس ایمن است؟
میتواند باشد، با حفاظها. از اعتبارنامههای کمترین امتیاز استفاده کنید، دسترسی را به شدت محدود کنید، و فیلترهای ایمنی و محتوا را فعال کنید—به ویژه در محیطهای سازمانی. از عامل بخواهید قبل از تعهد به اقدامات پرخطر، مراحل را پیشنمایش یا توضیح دهد.