بعد از خوندن این مقاله نگاهتون ب مدل های زبانی جدید عوض خواهد شد.
چطور از AI به جای جواب گرفتن، کار تحویل بگیریم! (بشخصه دارم از استفاده کردنش لذت میبرم. جلوتر متوجه میشیم چرا خرید ی اکانت 20 دلار میتونه کاری رو براتون انجام بده ک هیچ مدل رایگانی حتی نزدیکش هم نیست.)
درضمن توضیح میدم چطور خرید امن اکانت GPT رو انجام دادم در انتها.
بیشتر ما هنوز با هوش مصنوعی مثل یه موتور جستجوی پرحرف رفتار میکنیم و این قبلتر هم گفتم ک: سوال میپرسیم، جواب میگیریم و بقیه کار رو خودمون انجام میدیم. درسته؟ اما مدل Sol وقتی واقعا به درد میخوره که به جای یه سوال، یه کار کامل بهش بدیم: هدف، فایلها و ابزارها، محدودیتها و یه تعریف روشن از «تموم شدن» بگیرم. بعد هم ازش بخوایم تا وقتی به نتیجهای قابل بررسی نرسیده، کار رو ادامه بده.
این فرق کوچیک به نظر میاد، ولی دقیقا همون مرز بین «چتبات» و «عامل اجرایی» هست.
دوستان GPT‑5.6 Sol دقیقا چیه؟(میتونید اسکیپ کنید)
شرکت OpenAI از Sol به عنوان مدل پرچمدار و Frontier خانواده GPT‑5.6 اسم میبره. عرضه تدریجی Sol، Terra و Luna از ۹ جولای ۲۰۲۶ در ChatGPT، Codex و API شروع شده.
توی ارزیابی Artificial Analysis Coding Agent Index v1.1، نسخه GPT‑5.6 Sol با سطح استدلال max و هنگام اجرا در Codex، امتیاز ۸۰ گرفته. OpenAI میگه این مدل توی همون ارزیابی، نسبت به نزدیکترین مدل بعدی ۵۴ درصد توکن خروجی کمتری مصرف کرده و کار رو با ۵۷ درصد زمان کمتر تموم کرده.
ولی این بنچمارکها درباره پروژه واقعی شما هیچ تضمینی نمیدن. کیفیت خروجی هنوز به تعریف مسئله، داده، ابزار، تست و نظارت انسانی بستگی داره.
فرق اصلی: از جواب دادن تا جلو بردن کار
مدلهای قبلی هم متن و کد خوبی میساختن. فرق اینه که توی محیطهای عامل محور مثل Codex یا Responses API یا Hermes، و با دسترسی مناسب به فایل، ترمینال و مرورگر، میشه GPT‑5.6 رو داخل یه حلقه اجرایی گذاشت ک:(من خودم کودکس استفاده نمیکنم و وصلش کردم ب هرمس اما این مدل جدید کدکس حقیقتا تمیز هست و چت هم بهش اضافه شده ک خیلی کار رو جلو میندازه.)
برنامه بریزه، ابزار به کار بگیره، نتیجه رو ببینه و اگه لازم بود مسیرش رو عوض کنه.
مثلا اگه بگید «برای من یه داشبورد بساز»، احتمالا یه نمونه ظاهرا خوب تحویل میگیرید. ولی اگه مخزن کد، نیازهای محصول، محدودیتها و معیار پذیرش رو مشخص کنید، میشه از مدل خواست:
1. ساختار پروژه و نیازهای محصول رو بررسی کنه؛
2. برنامه اجرا و تستهای لازم رو بنویسه؛
3. کد رو تغییر بده و تست و build رو اجرا کنه؛
4. خروجی رو با معیارهای پذیرش مقایسه کنه؛
5. نتیجه و خطاهای باقی مونده رو شفاف گزارش بده.
گلوگاه از نوشتن پرامپت رفته سمت طراحی جریان کار. چیزی ک توییت قبلتر امروز توضیح دادم. توان مدل وقتی ارزش پیدا میکنه که پایان کار از قبل تعریف شده باشه و بشه نتیجه رو سنجید.
چه کارهایی رو میشه جدیتر به Sol سپرد?

۱. تحقیق برای تصمیم گرفتن، نه خلاصه کردن چند لینک
خود مدل به تنهایی تحقیق رو قابل اعتماد نمیکنه. ولی وقتی به مرورگر و منابع لازم دسترسی داشته باشه، میشه ازش خواست مسیر تحقیق رو مرتب کنه: منابع اصلی رو در اولویت بذاره، ادعاهای متناقض رو کنار هم بچینه، سطح اطمینان رو مشخص کنه و برای هر نتیجه مدرک بیاره.
مثلا به جای این درخواست:
> درباره آینده مدلهای متن باز تحقیق کن.
این درخواست دقیقتره:
> وضعیت مدلهای متن باز رو از نظر کیفیت، هزینه اجرا، مجوز، نیاز سخت افزاری و امکان استفاده تجاری بررسی کن. منابع اصلی رو در اولویت بذار. واقعیت، برداشت و نظر رو از هم جدا کن. در پایان سه فرصت، سه ریسک و یه پیشنهاد عملی برای کسی با ۱۲ گیگابایت VRAM بده.
بعد از خوندن این مقاله نگاهتون ب مدل های زبانی جدید عوض خواهد شد.
چطور از AI به جای جواب گرفتن، کار تحویل بگیریم! (بشخصه دارم از استفاده کردنش لذت میبرم. جلوتر متوجه میشیم چرا خرید ی اکانت 20 دلار میتونه کاری رو براتون انجام بده ک هیچ مدل رایگانی حتی نزدیکش هم نیست.)
درضمن توضیح میدم چطور خرید امن اکانت GPT رو انجام دادم در انتها.
بیشتر ما هنوز با هوش مصنوعی مثل یه موتور جستجوی پرحرف رفتار میکنیم و این قبلتر هم گفتم ک: سوال میپرسیم، جواب میگیریم و بقیه کار رو خودمون انجام میدیم. درسته؟ اما مدل Sol وقتی واقعا به درد میخوره که به جای یه سوال، یه کار کامل بهش بدیم: هدف، فایلها و ابزارها، محدودیتها و یه تعریف روشن از «تموم شدن» بگیرم. بعد هم ازش بخوایم تا وقتی به نتیجهای قابل بررسی نرسیده، کار رو ادامه بده.
این فرق کوچیک به نظر میاد، ولی دقیقا همون مرز بین «چتبات» و «عامل اجرایی» هست.
دوستان GPT‑5.6 Sol دقیقا چیه؟(میتونید اسکیپ کنید)
شرکت OpenAI از Sol به عنوان مدل پرچمدار و Frontier خانواده GPT‑5.6 اسم میبره. عرضه تدریجی Sol، Terra و Luna از ۹ جولای ۲۰۲۶ در ChatGPT، Codex و API شروع شده.
توی ارزیابی Artificial Analysis Coding Agent Index v1.1، نسخه GPT‑5.6 Sol با سطح استدلال max و هنگام اجرا در Codex، امتیاز ۸۰ گرفته. OpenAI میگه این مدل توی همون ارزیابی، نسبت به نزدیکترین مدل بعدی ۵۴ درصد توکن خروجی کمتری مصرف کرده و کار رو با ۵۷ درصد زمان کمتر تموم کرده.
ولی این بنچمارکها درباره پروژه واقعی شما هیچ تضمینی نمیدن. کیفیت خروجی هنوز به تعریف مسئله، داده، ابزار، تست و نظارت انسانی بستگی داره.
فرق اصلی: از جواب دادن تا جلو بردن کار
مدلهای قبلی هم متن و کد خوبی میساختن. فرق اینه که توی محیطهای عامل محور مثل Codex یا Responses API یا Hermes، و با دسترسی مناسب به فایل، ترمینال و مرورگر، میشه GPT‑5.6 رو داخل یه حلقه اجرایی گذاشت ک:(من خودم کودکس استفاده نمیکنم و وصلش کردم ب هرمس اما این مدل جدید کدکس حقیقتا تمیز هست و چت هم بهش اضافه شده ک خیلی کار رو جلو میندازه.)
برنامه بریزه، ابزار به کار بگیره، نتیجه رو ببینه و اگه لازم بود مسیرش رو عوض کنه.
مثلا اگه بگید «برای من یه داشبورد بساز»، احتمالا یه نمونه ظاهرا خوب تحویل میگیرید. ولی اگه مخزن کد، نیازهای محصول، محدودیتها و معیار پذیرش رو مشخص کنید، میشه از مدل خواست:
1. ساختار پروژه و نیازهای محصول رو بررسی کنه؛
2. برنامه اجرا و تستهای لازم رو بنویسه؛
3. کد رو تغییر بده و تست و build رو اجرا کنه؛
4. خروجی رو با معیارهای پذیرش مقایسه کنه؛
5. نتیجه و خطاهای باقی مونده رو شفاف گزارش بده.
گلوگاه از نوشتن پرامپت رفته سمت طراحی جریان کار. چیزی ک توییت قبلتر امروز توضیح دادم. توان مدل وقتی ارزش پیدا میکنه که پایان کار از قبل تعریف شده باشه و بشه نتیجه رو سنجید.
چه کارهایی رو میشه جدیتر به Sol سپرد?

۱. تحقیق برای تصمیم گرفتن، نه خلاصه کردن چند لینک خود مدل به تنهایی تحقیق رو قابل اعتماد نمیکنه. ولی وقتی به مرورگر و منابع لازم دسترسی داشته باشه، میشه ازش خواست مسیر تحقیق رو مرتب کنه: منابع اصلی رو در اولویت بذاره، ادعاهای متناقض رو کنار هم بچینه، سطح اطمینان رو مشخص کنه و برای هر نتیجه مدرک بیاره. مثلا به جای این درخواست: > درباره آینده مدلهای متن باز تحقیق کن. این درخواست دقیقتره: > وضعیت مدلهای متن باز رو از نظر کیفیت، هزینه اجرا، مجوز، نیاز سخت افزاری و امکان استفاده تجاری بررسی کن. منابع اصلی رو در اولویت بذار. واقعیت، برداشت و نظر رو از هم جدا کن. در پایان سه فرصت، سه ریسک و یه پیشنهاد عملی برای کسی با ۱۲ گیگابایت VRAM بده.
💬 نظرات (0)
برای ارسال نظر باید وارد شوید یا ثبتنام کنید.
هنوز نظری ثبت نشده است. اولین نفری باشید که نظر میدهید!