مقدمه
در تاریخ ۵ فوریه ۲۰۲۶، GPT-5.3-Codex، پیشرفتهترین مدل کدنویسی agentic خود تا به امروز را معرفی کرد. این انتشار، نقطهی عطفی مهم در هوش مصنوعی است—نه تنها به دلیل قابلیتهای فنی چشمگیرش، بلکه به این دلیل که این اولین مدلی است که در ساختن خود نقش اساسی داشته است.
نشاندهندهی تغییری اساسی از یک ابزار کدنویسی به یک همکار هوش مصنوعی تعاملی است که قادر به انجام کارهای فنی طولانیمدت و دنیای واقعی در طیف کاملی از وظایف محاسباتی حرفهای است.
چه چیزی را متمایز میکند؟
یک مدل Agentic واقعی
برخلاف دستیارهای کدنویسی سنتی که صرفاً قطعههای کد تولید میکنند، به عنوان یک مدل "agentic" طراحی شده است. این بدان معناست که میتواند:
- حفظ زمینه در طول کارهای طولانیمدت که ساعتها یا حتی روزها طول میکشند
- استفاده از ابزارها به طور مستقل، از جمله رابطهای خط فرمان، سیستمهای فایل و محیطهای توسعه
- انطباق و تکرار بر اساس بازخورد بیدرنگ بدون از دست دادن جایگاه خود
- مدیریت جریانهای کاری پیچیده چند مرحلهای که نیاز به تحقیق، برنامهریزی و اجرا دارند
دستاورد خودساز
شاید قابل توجهترین جنبهی این باشد که تیم از نسخههای اولیهی مدل برای موارد زیر استفاده کرده است:
- رفع اشکال فرایند آموزش خود
- تشخیص نتایج آزمایش و ارزیابیها
- بهینهسازی زیرساخت برای انتشار نهایی
این چرخهی توسعه خودارجاعی نشان میدهد که چگونه هوش مصنوعی شروع به تسریع بهبود خود میکند—نقطهی عطفی که محققان توصیف کردند که آنها را "از میزان توانایی در تسریع توسعه خود شگفتزده کرده است".
بهبود عملکرد
GPT-5.2-Codex به لطف بهبودهای زیرساخت GPT-5.2-Codex و پشتهی استنتاج، GPT-5.2-Codex از نسخهی قبلی خود (GPT-5.2-Codex) است. این بهبود سرعت، همکاری بیدرنگ پاسخگوتر و چرخههای تکرار سریعتر را امکانپذیر میکند.
عملکرد معیار: دادهها
در چندین معیار کلیدی که کدنویسی، قابلیتهای agentic و استفاده از کامپیوتر در دنیای واقعی را اندازهگیری میکنند، به عملکردی در سطح جهانی دست مییابد.
SWE-Bench Pro
SWE-Bench Pro یک ارزیابی دقیق از مهندسی نرمافزار در دنیای واقعی است که چهار زبان برنامهنویسی (پایتون، جاوااسکریپت، تایپاسکریپت و گو) را در بر میگیرد. برخلاف نسخهی قبلی خود () که فقط پایتون را آزمایش میکرد، طوری طراحی شده است که در برابر آلودگی مقاومتر و مرتبط با صنعت باشد.
Terminal-Bench 2.0
GPT-5.3-Codex در GPT-5.3-Codex بهویژه قابل توجه است. این معیار، مهارتهای ترمینالی را اندازهگیری میکند که یک عامل کدنویسی به آن نیاز دارد—پیمایش سیستمهای فایل، اجرای دستورات و مدیریت جریانهای کاری توسعه. شایان ذکر است، GPT-5.3-Codex این کار را با توکنهای کمتری نسبت به هر مدل قبلی انجام میدهد و آن را کارآمدتر میکند.
OSWorld-Verified
GPT-5.3-Codex در GPT-5.3-Codex قابلیتهای استفاده از کامپیوتر را به طور چشمگیری بهبود میبخشد. GPT-5.3-Codex یک معیار استفاده از کامپیوتر agentic است که در آن عوامل باید وظایف بهرهوری را در یک محیط دسکتاپ بصری تکمیل کنند. این بهبود چشمگیر نشان میدهد که GPT-5.3-Codex در پیمایش رابطهای دنیای واقعی بسیار بهتر از مدلهای قبلی است.
فراتر از کد: یک عامل چند منظوره
در حالی که در برنامهنویسی برتری دارد، قابلیتهای آن فراتر از تولید کد است. آن را به عنوان عاملی معرفی میکند که میتواند "تقریباً هر کاری را که توسعهدهندگان و متخصصان میتوانند روی یک کامپیوتر انجام دهند" انجام دهد.
پشتیبانی از چرخهی عمر نرمافزار
این مدل برای پشتیبانی از کل چرخهی توسعه نرمافزار ساخته شده است:
- اشکالزدایی - شناسایی و رفع اشکالات
- استقرار - مدیریت نسخهها و زیرساخت
- نظارت - پیگیری عملکرد و معیارها
- نوشتن PRDها - اسناد نیازمندیهای محصول
- ویرایش متن - مستندات و متن بازاریابی
- تحقیقات کاربر - تجزیه و تحلیل بازخورد کاربر
- آزمایش - نوشتن و اجرای مجموعههای آزمایشی
- تحلیل معیارها - تصمیمگیری مبتنی بر داده
قابلیتهای کار دانش
در GPT-5.2 (ارزیابی GPT-5.2 در سال ۲۰۲۵ که عملکرد در وظایف کار دانش را در ۴۴ شغل اندازهگیری میکند)، GPT-5.2 با عملکرد GPT-5.2 مطابقت دارد. این شامل وظایفی مانند:
- تجزیه و تحلیل دادهها در صفحات گسترده
مثال توسعه وب
برای نشان دادن قابلیتهای مدل، از خواست که دو بازی کامل را از ابتدا بسازد:
- یک بازی مسابقهای (نسخه ۲ بازی راهاندازی برنامهی <a2>Codex</a2>)
فقط با استفاده از مهارت "توسعه بازی وب" و دستورات پیگیری عمومی مانند "رفع اشکال" یا "بهبود بازی" به طور مستقل بر میلیونها توکن تکرار شد و بازیهای بسیار کاربردی و صیقلی ساخت.
درک بهتر هدف
در مقایسه با ، مدل جدید هنگام ساخت وبسایتها، هدف کاربر را بهتر درک میکند. دستورات ساده یا نامشخص اکنون به طور پیشفرض به سایتهایی با:
به عنوان مثال، هنگامی که از خواسته شد یک صفحهی فرود قیمتگذاری بسازد، به طور خودکار طرح سالانه را به عنوان قیمت ماهانه تخفیفخورده نمایش داد (و تخفیف را واضح کرد) و یک چرخ فلک شهادت متحرک خودکار با سه نقل قول مجزای کاربر ایجاد کرد—که منجر به یک طراحی کاملتر و صیقلیتر شد.
همکاری تعاملی
یکی از مهمترین پیشرفتهای تجربهی کاربری، توانایی هدایت مدل در حین کار است.
تعامل بیدرنگ
به جای انتظار برای یک خروجی نهایی، کاربران اکنون میتوانند:
- در مورد رویکردهای مختلف بحث کنند
- به سمت راهحلهای خاص هدایت کنند
- بازخورد در اواسط کار ارائه دهند
Settings > General > Follow-up behavior در مورد کارهایی که انجام میدهد صحبت میکند، به بازخوردها پاسخ میدهد و کاربران را از ابتدا تا انتها در جریان قرار میدهد. این را میتوان در برنامهی Settings > General > Follow-up behavior از طریق Settings > General > Follow-up behavior فعال کرد.
این تجربه را از دادن دستور به یک ماشین به همکاری با یک همتیمی تبدیل میکند—تغییری اساسی در نحوهی تعامل انسان با سیستمهای هوش مصنوعی.
قابلیتها و ایمنی امنیت سایبری
اولین مدلی است که <a2>OpenAI اولین مدلی است که <a2>OpenAI تحت چارچوب آمادگی خود، آن را به عنوان "قابلیت بالا" برای وظایف مرتبط با امنیت سایبری طبقهبندی میکند</a2>. این همچنین اولین مدلی است که مستقیماً برای شناسایی آسیبپذیریهای نرمافزاری آموزش داده شده است.
ماهیت دوگانه
از آنجایی که امنیت سایبری ذاتاً دوگانه است (برای دفاع و حمله مفید است)، یک رویکرد پیشگیرانه اتخاذ میکند:
- هیچ مدرک قطعی وجود ندارد که بتواند حملات سایبری را به طور کامل خودکار کند
- استقرار پشتهی ایمنی جامع امنیت سایبری
- اجرای آموزش ایمنی و نظارت خودکار
- ملزم کردن دسترسی مورد اعتماد برای قابلیتهای پیشرفته
دسترسی مورد اعتماد برای سایبر
دسترسی مورد اعتماد برای سایبر در حال راهاندازی دسترسی مورد اعتماد برای سایبر، یک برنامهی آزمایشی برای:
- تسریع تحقیقات دفاع سایبری
- در ابتدا ابزارها را به مدافعان ارائه دهد
- از تابآوری اکوسیستم پشتیبانی کند
تعهد ۱۰ میلیون دلاری
۱۰ میلیون دلار اعتبار API با تکیه بر برنامهی کمک هزینهی امنیت سایبری ۱ میلیون دلاری از سال ۲۰۲۳، ۱۰ میلیون دلار اعتبار API برای تسریع دفاع سایبری، به ویژه برای:
عامل امنیتی Aardvark
Next.js در حال گسترش نسخهی بتای خصوصی Next.js، عامل تحقیقات امنیتی خود، به عنوان اولین پیشنهاد در مجموعهی محصولات و ابزارهای امنیتی Next.js است. آنها همچنین با نگهدارندگان متن باز همکاری میکنند تا اسکن کدبیس رایگان برای پروژههای پرکاربرد مانند Next.js ارائه دهند.
چگونه از برای ساخت استفاده کرد
توسعهی یک مطالعه موردی جذاب در مورد تحقیقات تسریعشده توسط هوش مصنوعی ارائه میدهد.
موارد استفاده تیم تحقیقاتی
تیم تحقیقاتی از نسخههای اولیهی برای موارد زیر استفاده کرد:
- نظارت و اشکالزدایی از اجرای آموزشی برای انتشار
- پیگیری الگوها در طول دورهی آموزش
- ارائهی تحلیل عمیق در مورد کیفیت تعامل
- پیشنهاد اصلاحات و ساخت برنامههای کاربردی غنی برای محققان انسانی
- درک دقیق اینکه چگونه رفتار مدل با مدلهای قبلی متفاوت است
موارد استفاده تیم مهندسی
تیم مهندسی از برای موارد زیر استفاده کرد:
- بهینهسازی و تطبیق هارنس برای <a2>GPT-5.3-Codex</a2>
- شناسایی اشکالات رندر زمینه که بر کاربران تأثیر میگذارد
- ریشهیابی نرخ پایین ضربهی کش
- مقیاسبندی دینامیکی خوشههای GPU برای تنظیم با افزایش ترافیک
- حفظ پایداری تأخیر در طول راهاندازی
موارد استفاده علوم داده
در طول آزمایش آلفا، یک دانشمند داده با همکاری کرد تا:
- سازندههای regex برای تخمین فراوانی توضیحات، پاسخهای کاربر و پیشرفت کار بسازد
- این سازندهها را به طور مقیاسپذیر بر روی تمام گزارشهای جلسه اجرا کند
- خطوط لولههای داده جدید بسازد و نتایج را غنیتر از ابزارهای داشبورد استاندارد تجسم کند
- نتایج را به طور مشترک تجزیه و تحلیل کند، در حالی که <a2>Codex</a2> بینشهای کلیدی را بر روی هزاران نقطه داده در کمتر از سه دقیقه خلاصه میکند
افزایش بهرهوری
نتیجه؟ افرادی که با میسازند، خوشحالتر بودند زیرا عامل:
- قصد آنها را بهتر درک میکرد
- در هر نوبت پیشرفت بیشتری داشت
- سؤالات توضیحی کمتری میپرسید
دسترسی و قیمتگذاری
نحوه دسترسی
Codex Codex برای کاربران پولی Codex در تمام سطوح Codex:
- برنامه دسکتاپ (macOS و Windows)
- افزونههای IDE (VS Code, JetBrains و غیره)
برنامههای اشتراک
برای مدت محدودی، برنامههای پولی دو برابر محدودیتهای نرخ معمولی را دریافت میکنند.
قیمتگذاری API
از زمان راهاندازی، OpenAI قیمتگذاری رسمی API را برای <a2>GPT-5.3-Codex منتشر نکرده است</a2>. دسترسی به API به عنوان "به زودی عرضه میشود" و "در هفتههای آینده عرضه میشود" توصیف شده است.
برای مرجع، قیمتگذاری فعلی API برای مدل قبلی () به شرح زیر است:
زیرساخت
NVIDIA به طور مشترک برای سیستمهای NVIDIA طراحی، با آنها آموزش داده و روی آنها ارائه شده است—گواهی بر همکاری نزدیک بین NVIDIA و NVIDIA در پیشبرد مرزهای قابلیت هوش مصنوعی.
مقایسه با رقبا
انتشار Anthropic تنها چند دقیقه پس از اعلام Anthropic توسط Anthropic صورت گرفت و یک مقایسهی فوری بین این دو مدل را ایجاد کرد.
نقاط قوت
- Terminal-Bench 2.0: 77.3 در مقابل 65.4 <a2>Opus 4.6 (مزیت +18.6%)</a2>
- فلسفهی طراحی "قابلیت اطمینان بالا، واریانس پایین"
- قابلیت خودسازی (به ساختن خود کمک کرد)
- اولین طبقهبندی امنیت سایبری "قابلیت بالا"
نقاط قوت
- پنجرهی زمینهی ۱ میلیون توکن (به طور قابل توجهی بزرگتر)
- تیمهای عامل قابلیت همکاری
- تطبیقپذیری گستردهتر در سناریوهای کار دانش
- دمای خلاقیت بالاتر (شخصیت بیشتر)
تفاوتهای فلسفهی طراحی
تصویر بزرگتر
عاملهای چند منظوره است که میتوانند در طیف کاملی از کارهای فنی دنیای واقعی استدلال، ساخت و اجرا کنند چیزی بیش از یک ارتقای تدریجی است—این یک تغییر گام به سوی عاملهای چند منظوره است که میتوانند در طیف کاملی از کارهای فنی دنیای واقعی استدلال، ساخت و اجرا کنند.
از عامل کد به عامل کامپیوتر
به صراحت این تکامل را چارچوببندی میکند: " در حال حرکت از نوشتن کد به استفاده از آن به عنوان ابزاری برای کار با یک کامپیوتر و تکمیل کار به طور کامل است."
این یک تغییر عمیق است. آنچه به عنوان تمرکز بر "بهترین عامل کدنویسی" شروع شد، به پایهای برای یک همکار عمومیتر در کامپیوتر تبدیل شده است—گسترش هم اینکه چه کسی میتواند بسازد و هم آنچه با هوش مصنوعی ممکن است.
تسریع توسعه هوش مصنوعی
این واقعیت که به ساختن خود کمک کرد، پیشنمایشی از آنچه در راه است است. همانطور که محققان اشاره میکنند، "بسیاری از محققان و مهندسان در امروزه شغل خود را اساساً متفاوت از آنچه که فقط دو ماه پیش بود توصیف میکنند."
این نشان میدهد که ما وارد دورهای از بازدهی شتابدهنده در توسعه هوش مصنوعی میشویم، جایی که هر نسل از مدلها به ساخت نسل بعدی کمک میکند—به طور بالقوه جدول زمانی را از سالها به ماهها فشرده میکند.
پیامدها برای توسعهدهندگان
برای توسعهدهندگان نرمافزار، پیامدها قابل توجه هستند:
- چرخههای توسعه سریعتر - هوش مصنوعی بیشتر کارهای معمول را انجام میدهد
- تجرید سطح بالاتر - توسعهدهندگان میتوانند بر معماری و طراحی تمرکز کنند
- همکاری تعاملی - کمتر شبیه استفاده از یک ابزار، بیشتر شبیه کار با یک همتیمی
- قابلیتهای جدید - وظایفی که قبلاً به دانش تخصصی نیاز داشتند اکنون در دسترس هستند
پیامدها برای مشاغل
برای مشاغل، نشاندهندهی:
- افزایش بهرهوری - کار بیشتری در زمان کمتری انجام میشود
- موانع کمتر - مهارتهای تخصصی کمتری برای وظایف خاص مورد نیاز است
- ملاحظات امنیتی جدید - طبقهبندی امنیت سایبری "قابلیت بالا" نیاز به حاکمیت دقیق دارد
- مزیت رقابتی - پذیرش زودهنگام هوش مصنوعی عامل قدرتمند
نتیجهگیری
یک دستاورد مهم در هوش مصنوعی است. این ترکیبی از:
- عملکرد کدنویسی در سطح جهانی
- خودبهبودی (به ساختن خود کمک کرد)
- استفاده از کامپیوتر در دنیای واقعی
این واقعیت که در ایجاد خود نقش اساسی داشته است، هم به عنوان یک دستاورد فنی و هم به عنوان استعارهای برای جایی که هوش مصنوعی به آن سمت میرود عمل میکند. با توانمندتر شدن مدلها، آنها فقط ابزارهایی نیستند که ما از آنها استفاده میکنیم—آنها در حال تبدیل شدن به شرکایی در خود فرآیند خلاقیت و توسعه هستند.
انتشار همزمان با ، فقط با چند دقیقه فاصله، بر شدت رقابت در فضای هوش مصنوعی تأکید میکند. اما مهمتر از آن، این نشان میدهد که ما وارد مرحلهی جدیدی از قابلیت هوش مصنوعی شدهایم—مرحلهای که در آن عاملها میتوانند به طور قابل اعتمادی وظایف پیچیده و طولانیمدت را در طیف کاملی از کارهای کامپیوتری حرفهای انجام دهند.
همانطور که میگوید: "آنچه به عنوان تمرکز بر بهترین عامل کدنویسی شروع شد، به پایهای برای یک همکار عمومیتر در کامپیوتر تبدیل شده است."
اکنون سوال این نیست که این مدلها چه کاری میتوانند انجام دهند—سوال این است که ما چه چیزی را با آنها خواهیم ساخت.
منابع
سلب مسئولیت: این مقاله بر اساس اطلاعات موجود تا ۶ فوریه ۲۰۲۶ است. مشخصات، قیمتگذاری و در دسترس بودن ممکن است تغییر کند. لطفاً برای اطلاع از جدیدترین اطلاعات، به مستندات رسمی مراجعه کنید.