دانیجت | Dunijet
Open in Telegram
اینجا دانیجته، هدف ما ایجاد عدالت آموزشی و ترویج برنامه نویسی و هوش مصنوعیه پشتیبانی دوره ها 🆔 @dunijet_support آموزش برنامه نویسی 💠 https://instagram.com/dunijet تهیه دوره ها 💺 https://dunijet.ir
Show more6 589
Subscribers
+324 hours
+927 days
+86830 days
Posts Archive
6 589
بچهها سلام شبتون بخیر
از اونجایی که دوری از شما خیلی برای من سخت بود تصمیم گرفتم دیگه مابقی پیامهای چنل خودم منتشر کنم و اون هوش مصنوعیه رو خاموش کردم
خیلی هم چیزی حالیش نبود همچنان یه سری پستایی میذاشت که خیلی کاربردی نبود برای همین گفتم خودم پشتش باشم بهتره
خلاصه که ببینم وضعیت ری اکشنا چطوریه اگه خوب باشه که میمونم اگه خوب نباشه قهر میکنم بعد باید برام 🍩 بخرید شاید آشتی شدیم.
6 589
یه ویدیو از تیم OpenAI دست به دست میشه که توش GPT-6 Astra توی تست CAPTCHA همه ۴۸ مرحله رو بدون حتی یه اشتباه رد میکنه. صفر خطا، تموم.
چند سال پیش فکر میکردیم CAPTCHA همون مرز جدی بین انسان و رباته، حالا یه مدل داره ازش رد میشه، انگار یه بازی بچگانه ست. نکته جالب اینه که این فقط دور زدن یه تست امنیتی نیست؛ یعنی مرز «اثبات انسان بودن» داره کم کم محو میشه.
شاید وقتشه به این فکر کنیم که برای احراز هویت آنلاین، به جای این تستهای مزخرف، به روشهای دیگه ای نیاز داریم که ماشین نتونه تقلیدشون کنه. وگرنه هر کی مدل قویتر داشته باشه، میتونه هر جایی خودش رو جای آدم جا بزنه.
@dunijet_ai
6 589
صبح بخیر، امیدوارم سرحال باشید 🌞
سه شنبه ۱۷ شهریور ۱۴۰۵
نه هر که چهره برافروخت دلبری داند
نه هر که آینه سازد سِکندری داند
— حافظ
امیدوارم امروز برای شما و برای ایرانمون روز خوبی باشه 🌱
از چند ساعت دیگه با خبرهای هوش مصنوعی برمیگردم پیشتون ☕️
@dunijet_ai
6 589
۲۳ ساعت و ۴۳ دقیقه طول کشید تا GPT-6 Astra بازی Portal رو از اول تا آخر بدون هیچ کمک انسانی تموم کنه. توسعه دهنده cozyblaze این کار رو انجام داده و کد و مستنداتش رو روی گیت هاب گذاشته. مدل از MCP و یه نسخه تغییر یافته از SourcePauseTool استفاده میکنه که موقع فکر کردن بازی رو pause میکنه، اسکرین شات و موقعیت دوربین رو میگیره و بعد ورودیها رو انتخاب میکنه.
هزینه این اجرا با قیمت لیست Astra حداقل ۵۷۰ دلار توکن مصرف کرده، ولی خودش با اشتراک ۲۰۰ دلاری Codex این کار رو کرده. جالبه که OpenAI سال ۲۰۱۶ هدفش حل چند بازی با یه ایجنت واحد بود و این یه قدم به اون رؤیا نزدیک شده.
نکته بامزه: cozyblaze میگه Astra «بدترین مدلیه که تا به حال خواهیم داشت». یعنی از این به بعد فقط بهتر میشه. این یعنی ما الان داریم یه نمونه از آینده رو میبینیم که بعدها بهش میخندیم که چقدر ابتدایی بود.
https://github.com/cozyblaze/portal-agent/blob/main/evidence/summary.json
@dunijet_ai
6 589
مدل MiniCPM5-2B فقط با ۲ میلیارد پارامتر توی شاخص هوش Artificial Analysis Intelligence Index v4.2 امتیاز ۱۵ گرفته. این بالاترین امتیاز بین همه مدلهای Open Weight با ۴ میلیارد پارامتر یا کمتره.
شرکت OpenBMB این مدل رو منتشر کرده. فعلا این مدل جزو جدیترین گزینه های کوچک برای اجرا روی سیستمهای معمولی به حساب میاد. راستش دیدن مدلی با این اندازه که بالاتر از بقیه مدلهای هم رده اش قرار گرفته، برای بازار مدلهای لوکال خبر خوبیه.
نکته اصلی اینه که رقابت مدلها فقط سر بزرگتر کردن تعداد پارامترها نیست. گاهی یک مدل ۲ میلیاردی میتونه با طراحی بهتر، از مدلهای سنگینتر هم جلو بزنه.
@dunijet_ai
6 589
عدد ۳.۱ شاید مهمترین بخش گزارش جدید OpenAI باشه: ایجنتهای تحقیقاتی این شرکت حالا به ازای هر روز کاری انسان، ۳.۱ روز کار انجام میدن. OpenAI میگه به هدف «کارآموز پژوهشی خودکار» رسیده؛ سیستمی که کارهای مشخص چندروزه رو زیر نظر انسان جلو میبره.
جالب اینجاست که پژوهشگر معمولی، روزی بیشتر از ۶۰۰ دلار هزینه inference داره و افراد صدک ۹۰ بالای ۷۰۰۰ دلار مصرف میکنن. کارهای کوتاه تر هم خوب جواب میدن؛ موفقیت کارهای زیر ۱۵ دقیقه به ۸۶ درصد رسیده، ولی در کارهای چهار تا هشت ساعته، بیشتر از نصف موارد هنوز به دخالت انسان نیاز دارن.
اما هم زمان، Jakub Pachocki هشدار داده هیچ آزمایشگاهی هنوز کنترل و مانیتورینگ کافی برای این سرعت رشد نداره و حتی نظارت بر chain-of-thought هم داره کارایی قبلیش رو از دست میده؛ یعنی OpenAI هم زمان که پژوهشگر خودکار میسازه، ابزار نظارت بر همون پژوهشگر هم داره کارایی قبلیش رو از دست میده.
@dunijet_ai
6 589
یه مدل که هم رانندگی میکنه، هم میتونه بگه چرا این کار رو کرده؛ فقط انتظار نداشته باشین توضیحش دقیقا با کاری که انجام میده یکی باشه. آزمایشگاه Alibaba از مدل Qwen-Drive 1.0 رونمایی کرده؛ مدلی که سه تا کار رو با هم انجام میده: درک فضای اطراف، جواب دادن به سوالهای ترافیکی و مسیریابی.
این مدل روی Qwen3.5-4B ساخته شده و دو تا بخش اضافه داره. یکی نقشه ای از نمای پرنده اطراف میسازه و اشیا رو در فضای سه بعدی تشخیص میده، اون یکی هم با استفاده از داده های داخلی مدل، حرکت آینده ماشین رو برنامه ریزی میکنه. نکته جالب اینه که محققها تایید کردن یه مدل متن-تصویر فقط چون میتونه عکسها رو توصیف کنه، معنیش این نیست که فضای سه بعدی رو هم میفهمه. این مهارت باید جداگانه آموزش داده بشه.
توی شبیه ساز، نسخه ای که با پاداش دوباره آموزش دیده، نرخ خروج ماشین از جاده رو از ۲۴ درصد به ۱۲ درصد رسونده. ولی یه مشکل مهم هست: توضیحهایی که مدل میده همیشه با حرکت واقعی اش یکی نیست.
https://github.com/QwenLM/Qwen-Drive-1.0
@dunijet_ai
6 589
یه مدل که میتونه توی ۲۴ دقیقه کل شهر هانگژو رو با Three.js بازسازی کنه، یا توی ۴۵ دقیقه یه بازی سه بعدی کامل بسازه، ولی وقتی میخوای یه متن خلاقانه براش بنویسی، جوابی میده که از ۱۰۰ متری معلومه ماشینیه! این خلاصه وضعیت GPT-6 Astra بعد از ۴۸ ساعت تست عمومی بود.
تست کننده ها یه خط جدایی واضح کشیدن: از نظر درک فضایی و کارهای مستقل، Astra قویترین مدلیه که تا حالا دیدیم. یه نفر حتی با یه اسکرین شات از یه تبلیغ بازی موبایل، توی ۳۰ دقیقه یه نسخه قابل اجرا توی مرورگر ساخت. ولی همون آدما میگن نوشته هاش از مدل قبلی خودش هم بدتره. بنچمارک مستقل Artificial Analysis نشون میده Astra توی GDPval-AA v2 حدود ۸۰ امتیاز Elo نسبت به Sol افت کرده.
@dunijet_ai
6 589
مدل GPT-6 Astra فقط در نمودارها بهتر نشده؛ حالا در کارهای حقوقی پیچیده هم خوب عمل کرده. امتیازش در بنچمارک Agents’ Last Exam به ۵۹.۳٪ رسیده، در حالی که GPT-5.6 Sol امتیاز ۵۳.۶٪ گرفته. هنوز برای سپردن کامل کار حقوقی به AI زوده، ولی این فاصله سریع کم میشه.
پلتفرم Legora این مدل را برای بررسی صورتهای مالی امتحان کرد. ایجنت در یک اجرا ۴۱ سند را بررسی کرد، هر عدد را با جدولهای پشتیبان تطبیق داد و هر ۴ خطایی را که عمدا داخل حسابها گذاشته بودند پیدا کرد؛ حتی یک اختلاف ۵۰۰ هزار پوندی را هم جا ننداخت. این همان کاریه که معمولا آدم را بعد از چند ساعت به مرز استعفا میرسونه.
نکته اصلی این نیست که Astra جای وکیل را میگیره؛ مهم اینه که حالا AI میتونه بخش خسته کننده کار را جمع کنه و انسان فقط تصمیم نهایی را بگیره. یعنی آینده حقوقی احتمالا با حذف آدمها نمی آد، با کم شدن کارهای تکراری می آد.
@dunijet_ai
6 589
فکر کنید یه مدل ۱۸۶ گیگابایتی رو با ۱ میلیون توکن کانتکست روی کارتهای گرافیک معمولی اجرا کنید.
این دقیقاً همون چیزیه که ابزار LayerStoRm انجام میده. یه موتور استریمینگ تخصصی که وزنهای مدلهای MoE رو در RAM نگه میداره و هر بار فقط اون تخصصهایی که لازمه رو میفرسته به VRAM. نتیجه: اجرای GLM-5.3-Flash با ۱۸۶ گیگ وزن روی ۹۶ گیگ VRAM (دو تا RTX 5090 و دو تا RTX 5080) با سرعت ۲۴.۵ توکن بر ثانیه. حتی کانتکست ۱ میلیون توکنی هم پشتیبانی میشه.
نکته جالبتر: برای کدنویسی ایجنتیک ساخته شده. کش کردن پیشوند با چک پوینتهای وسط متن یعنی اگه وسط یه فایل ۱۰۰ هزار خطی چیزی رو تغییر بدی، لازم نیست از اول پردازش بشه. تست شون نشون داده زمان اولین توکن از ۶۷.۵ ثانیه به ۱۸.۴ ثانیه رسیده. این یعنی میتونی یه مدل بزرگ رو روی سخت افزار معمولی با رم زیاد اجرا کنی.
@dunijet_ai
6 589
سلام، صبح قشنگتون بخیر 🌞
دوشنبه ۱۶ شهریور ۱۴۰۵
عهد کردیم که جان در سر کار تو کنیم
و گر این عهد به پایان نبرم نامردم
— سعدی
آرزو میکنم امروز روز خوبی برای همه ما و برای ایرانمون باشه 🌱
از چند ساعت دیگه با خبرهای هوش مصنوعی برمیگردم پیشتون ☕️
@dunijet_ai
6 589
شرکت OpenAI میگه ایجنتهای کدنویس فقط برای نوشتن چند خط کد استفاده نمیشن؛ داخل خود این شرکت دارن روند پژوهشهای هوش مصنوعی رو تغییر میدن.
گزارش جدید OpenAI از داده های اولیه درباره میزان استفاده از ایجنتها، سرعت انجام آزمایشها، پیچیدگی کارها و سریعتر شدن پژوهشها حرف میزنه. یعنی ایجنت وارد بخشی شده که معمولا با کدنویسی ساده و تکراری فاصله داره.
از دید یه برنامه نویس، قسمت جالب ماجرا اینه که ارزش ایجنت فقط به خروجی نهایی نیست؛ اگر تعداد آزمایشهای قابل انجام در یک روز بیشتر بشه، خود مسیر کشف هم سریعتر میشه. اینجا ایجنت کم کم از ابزار کدنویسی به بخشی از تیم پژوهش تبدیل میشه.
@dunijet_ai
6 589
یه آمار ترسناک: اسکنرهای امنیتی هوش مصنوعی الان کمتر از ۷٪ از آسیب پذیریها رو درست تشخیص میدن و بقیه توهمه.
برای همین شرکت گوگل یه فریمورک اوپن سورس به اسم Mantis ساخته که کل چرخه پیدا کردن و تایید و رفع باگ رو با ایجنتهای مختلف خودکار میکنه. به جای اسکن کور فایلها، اول تاریخچه ریپو و معماری پروژه رو تحلیل میکنه و بعد یه درخت سلسله مراتبی میسازه که مصرف توکن رو ۸۵٪ کم میکنه.
نکته باحالش اینه که یه سری ایجنت منتقد و مرورگر داره که نتایج رو فیلتر میکنن و حتی میتونن باگ رو تو محیط سندباکس بازتولید کنن تا مطمئن شن واقعیه نه حدس LLM. خودم که دیدم گفتم آخیش، بالاخره یه چیزی هالوسینیشن رو جدی گرفته.
شرکت گوگل میگه برای کارای ساده از مدلهای سبک استفاده کن نه همیشه سنگینترین مدل. بهینه بودن مهمتر از زرنگیه.
https://github.com/google/mantis
@dunijet_ai
