مسترسا
مقاله مسترسا

آسترا آمد؛ OpenAI می‌گوید عصر ای‌جی‌آی شروع شده

۰ دیدگاه
چکیده

OpenAI با معرفی GPT-6 Astra یکی از بزرگ‌ترین جهش‌های خود در هوش مصنوعی عامل‌محور را به نمایش گذاشته است؛ مدلی که فقط برای پاسخ دادن ساخته نشده، بلکه می‌تواند با کامپیوتر و مرورگر کار کند، کد بنویسد، مسائل پیچیده را حل کند و بخشی از…

تصویر شاخص GPT-6 Astra و آغاز عصر هوش مصنوعی عامل‌محور

OpenAI با معرفی GPT-6 Astra یکی از بزرگ‌ترین جهش‌های خود در هوش مصنوعی عامل‌محور را به نمایش گذاشته است؛ مدلی که فقط برای پاسخ دادن ساخته نشده، بلکه می‌تواند با کامپیوتر و مرورگر کار کند، کد بنویسد، مسائل پیچیده را حل کند و بخشی از کارهای چندمرحله‌ای را تا انتها پیش ببرد.

جنجالی‌ترین جمله لانچ را گرگ براکمن مطرح کرد: «به عصر AGI خوش آمدید.» البته این جمله به معنی اعلام رسمی و قطعی تحقق AGI از سوی کل جامعه علمی نیست؛ چون هنوز تعریف واحدی برای «هوش عمومی مصنوعی» وجود ندارد. با این حال، عملکرد Astra نشان می‌دهد OpenAI می‌خواهد فاصله میان یک چت‌بات هوشمند و یک عامل اجرایی عمومی را بسیار کمتر کند.

آسترا چه چیزی را تغییر می‌دهد؟

یکی از مهم‌ترین قابلیت‌های GPT-6 Astra، Computer Use است. مدل می‌تواند رابط نرم‌افزارها و صفحات وب را ببیند، عناصر صفحه را تشخیص دهد، کلیک کند، فرم‌ها را تکمیل کند و مجموعه‌ای از مراحل متوالی را انجام دهد.

در ارزیابی‌های منتشرشده، Astra در OSWorld 2.0 حدود ۷۲٫۶ درصد و در ScreenSpot-Pro حدود ۹۲٫۷ درصد امتیاز گرفته است. این اعداد نشان می‌دهند مدل در تشخیص عناصر رابط کاربری و انجام وظایف دسکتاپی نسبت به نسل قبلی پیشرفت محسوسی داشته است.

برای کاربر عادی، معنی این پیشرفت بسیار ساده‌تر است: ChatGPT دیگر فقط نمی‌گوید یک کار را چگونه انجام دهید؛ در بعضی سناریوها می‌تواند خودش بخش زیادی از آن کار را انجام دهد.

چند عدد مهم از GPT-6 Astra

حوزه امتیاز Astra کاربرد
OSWorld 2.0 ۷۲٫۶٪ کار با محیط دسکتاپ
ScreenSpot-Pro ۹۲٫۷٪ تشخیص عناصر رابط کاربری
DeepSWE ۷۴٫۱٪ مهندسی نرم‌افزار
Terminal-Bench ۵۷٫۹٪ کارهای پیچیده ترمینال
BenchCAD ۹۵٫۹٪ طراحی و مهندسی CAD
FrontierMath Tier 4 ۹۷٫۶٪ ریاضیات بسیار دشوار
ARC-AGI-3 ۹۹٫۹٪ استدلال در محیط‌های جدید

این اعداد معیارهای آزمایشگاهی هستند و نباید آن‌ها را معادل عملکرد کامل در همه شرایط واقعی دانست؛ اما فاصله Astra با نسل‌های قبلی در بعضی حوزه‌ها قابل توجه است.

در برنامه‌نویسی، بیشتر شبیه همکار است تا چت‌بات

Astra در کدنویسی و مهندسی نرم‌افزار هم پیشرفت جدی داشته است. مدل می‌تواند روی پروژه‌های چندفایلی کار کند، خطاها را پیدا کند، کد را ریفکتور کند، تست اجرا کند و در محیط Terminal وظایف طولانی‌تری را پیش ببرد.

در DeepSWE امتیاز آن حدود ۷۴٫۱ درصد و در Terminal-Bench 4.0 حدود ۵۷٫۹ درصد گزارش شده است.

OpenAI همچنین Codex را برای سشن‌های طولانی‌تر بهبود داده تا بتواند یادداشت‌ها، تصمیم‌های قبلی و الزامات پروژه را بهتر حفظ کند. این موضوع برای پروژه‌های واقعی اهمیت زیادی دارد؛ چون یکی از مشکلات Agentهای کدنویسی قبلی، از دست رفتن بخشی از زمینه پروژه در مکالمات طولانی بود.

جهش بزرگ در استدلال و دانش تخصصی

یکی از بحث‌برانگیزترین نتایج Astra، امتیاز بسیار بالای آن در ARC-AGI-3 است؛ ارزیابی‌ای که هدف آن سنجش توانایی مدل برای حل مسائل جدید و سازگاری با محیط‌های ناآشناست.

در ریاضیات بسیار سخت نیز Astra روی FrontierMath Tier 4 حدود ۹۷٫۶ درصد و در GPQA Diamond حدود ۹۶ درصد ثبت کرده است.

این نتایج یکی از دلایلی است که دوباره بحث AGI را جدی کرده‌اند. با این حال، حتی چنین رکوردهایی به‌تنهایی اثبات نمی‌کنند که AGI به‌طور قطعی محقق شده است.

حتی وارد CAD و نرم‌افزارهای حرفه‌ای شده

Astra فقط در متن و کد قوی‌تر نشده است. در BenchCAD حدود ۹۵٫۹ درصد امتیاز گرفته و OpenAI نمونه‌هایی از کار مدل با ابزارهایی مانند KiCad، Blender و Unreal Engine نمایش داده است.

این بخش از ماجرا شاید از خود بنچمارک‌ها مهم‌تر باشد؛ چون نشان می‌دهد مدل‌های نسل جدید به‌تدریج از محیط چت خارج می‌شوند و وارد نرم‌افزارهایی می‌شوند که مهندسان، طراحان و متخصصان واقعاً هر روز با آن‌ها کار می‌کنند.

بخش حساس: امنیت سایبری

OpenAI اعلام کرده Astra در ارزیابی‌های امنیت سایبری به سطح بسیار بالایی رسیده و در برخی آزمون‌ها توانایی قابل توجهی در کشف و بهره‌برداری از آسیب‌پذیری‌ها نشان داده است.

در ExploitBench امتیاز کامل گزارش شده و در ارزیابی‌های داخلی نیز Astra توانسته دو آسیب‌پذیری Zero-Day را شناسایی کند.

به همین دلیل، نسخه عمومی همه توانایی‌های تهاجمی مدل را بدون محدودیت در اختیار کاربران قرار نمی‌دهد و OpenAI برای قابلیت‌های پرریسک، لایه‌های حفاظتی و دسترسی کنترل‌شده در نظر گرفته است.

آیا واقعاً وارد عصر AGI شده‌ایم؟

جمله گرگ براکمن که گفت «به عصر AGI خوش آمدید» احتمالاً بیش از همه تیتر خواهد شد.

اما بهتر است آن را یک اعلام تاریخی و تبلیغاتی از نگاه OpenAI بدانیم، نه یک اجماع علمی.

آنچه قابل مشاهده است این است که مدل‌ها در حال عبور از مرحله «پاسخ دادن» به مرحله «انجام دادن» هستند.

  • با مرورگر و دسکتاپ کار کند؛
  • پروژه نرم‌افزاری را جلو ببرد؛
  • داده تحلیل کند؛
  • در ابزارهای مهندسی کار کند؛
  • تسک‌های طولانی را دنبال کند؛
  • و چند ابزار را در یک Workflow کنار هم قرار دهد.

این تغییر شاید در عمل مهم‌تر از بحث نام‌گذاری AGI باشد.

برای کاربران ChatGPT چه زمانی عرضه می‌شود؟

مسیر عرضه Astra ابتدا از گروه‌ها و سازمان‌های منتخب شروع شده و سپس به کاربران Plus، Pro، Business و Enterprise گسترش پیدا می‌کند. مدل همچنین از طریق API و زیرساخت‌های ابری در اختیار توسعه‌دهندگان قرار می‌گیرد.

به همین دلیل ممکن است کاربران مختلف در زمان‌های متفاوت به آن دسترسی پیدا کنند.

تحلیل مسترسا

از نگاه مسترسا، مهم‌ترین اتفاق در GPT-6 Astra این نیست که در یک بنچمارک چند درصد بیشتر گرفته است.

نکته اصلی این است که چند توانایی که قبلاً جدا از هم بودند، حالا دارند داخل یک سیستم واحد جمع می‌شوند:

استدلال + حافظه + مرورگر + کامپیوتر + کدنویسی + ابزارهای حرفه‌ای + اتوماسیون

چند سال پیش از ChatGPT می‌پرسیدیم: «چطور این کار را انجام بدهم؟»

امروز به‌تدریج سؤال در حال تبدیل شدن به این است: «این کار را برای من انجام بده.»

اگر این روند ادامه پیدا کند، هوش مصنوعی دیگر فقط همکار فکری نخواهد بود؛ بلکه به همکار اجرایی تبدیل می‌شود.

جمع‌بندی

GPT-6 Astra یکی از جدی‌ترین تلاش‌های OpenAI برای ساخت یک عامل هوش مصنوعی عمومی‌تر است.

مدلی که علاوه بر گفتگو، می‌تواند وارد محیط‌های واقعی کار شود، با نرم‌افزارها تعامل کند، کد بنویسد، مسائل علمی حل کند و بخشی از Workflowهای پیچیده را اجرا کند.

هنوز زود است که با قطعیت بگوییم «AGI محقق شده»، اما یک چیز روشن است:

فاصله بین چت‌بات و عامل هوشمندی که واقعاً کار انجام می‌دهد، از همیشه کمتر شده است.

منابع

اشتراک‌گذاری Telegram LinkedIn X
QR
QR این صفحه
گفت‌وگو

دیدگاه شما

نظر، تجربه یا پرسش خود را بنویسید. برای جلوگیری از ارسال خودکار، پاسخ کوتاه امنیتی الزامی است.

مشارکت در بحث

ثبت دیدگاه

نشانی ایمیل شما منتشر نمی‌شود. فیلدهای ستاره‌دار الزامی هستند.

تأیید انسانی ۲۴ ÷ ۸ = ؟ حاصل عملیات ریاضی را با عدد فارسی یا انگلیسی وارد کنید.