en
Feedback
Nima Aksoy

Nima Aksoy

Open in Telegram

Daily AI News & Updates My personal website nimaaksoy.com contact me if you need AI advisor in your company

Show more
The country is not specifiedThe category is not specified
1 824
Subscribers
-124 hours
+137 days
+15030 days
Posts Archive
یک مدل برای کل علم؟ لاگوس (LOGOS) یک مدل متن‌بازه که به‌جای تمرکز روی یک حوزه، پروتئین‌ها، مولکول‌ها، مواد، واکنش‌های شیمیایی
یک مدل برای کل علم؟ لاگوس (LOGOS) یک مدل متن‌بازه که به‌جای تمرکز روی یک حوزه، پروتئین‌ها، مولکول‌ها، مواد، واکنش‌های شیمیایی و تعاملات بین آن‌ها را با یک زبان مشترک یاد می‌گیرد. مدل‌های 1B تا 8B پارامتری منتشر شده‌اند و هدفش اینه که به‌جای ساختن یک مدل جدا برای هر مسئله علمی، یک مدل واحد بتواند کارهای مختلف طراحی و کشف علمی را انجام دهد. ➡️ https://github.com/LOGOS-Hub/LOGOS

ربات‌ها بالاخره لمس رو حس می‌کنن یومی (UME) یه اسکلت بیرونی سبک و ارزونه که موقع کنترل ربات، فشار و گشتاور رو هم حس و ضبط می‌کنه. این باعث می‌شه ربات‌ها کارهای ظریف و تماسی توی خانه رو بهتر یاد بگیرن، مخصوصاً جاهایی که فقط دیدن کافی نیست. 🔖 https://ume-exo.github.io/

مدل‌های تصویری کوچیک دارن جدی می‌شن بوگو ایمیج (Boogu-Image) یک مدل متن‌باز برای تولید و ویرایش تصویره که با ۱۰ میلیارد پارام
مدل‌های تصویری کوچیک دارن جدی می‌شن بوگو ایمیج (Boogu-Image) یک مدل متن‌باز برای تولید و ویرایش تصویره که با ۱۰ میلیارد پارامتر به عملکردی نزدیک مدل‌های بزرگ‌تر و بسته رسیده. نسخه‌های مختلف برای تولید سریع، ویرایش تصویر و اجرای کم‌مصرف داره و تحت مجوز Apache 2.0 منتشر شده. از اینجا می‌تونید امتحان کنید ❤️ https://boogu.org/

این خیلی جالبه، حرکت دوربین رو کپی می‌کنه اُمنی‌دایرکتور (OmniDirector) می‌تونه سبک و حرکت دوربین یک ویدیو رو به ویدیوهای دیگه منتقل کنه، آن هم بدون نیاز به دیتاست‌های جفت‌شده و پرهزینه. این کار ساخت سکانس‌های چندشاتی با زبان تصویری یکدست رو خیلی ساده‌تر می‌کنه. 🔖 https://ymlinfeng.github.io/OmniDirector.github.io/

دیگه ادیت‌ها وسط راه گم نمی‌شن پرماوید (PermaVid) روشی جدید برای تولید و ویرایش ویدیوهای هوش مصنوعیه که بعد از اعمال تغییرات، اون تغییرات رو در طول زمان و از زاویه‌های مختلف حفظ می‌کنه و دوباره به حالت قبلی برنمی‌گرده. کد پروژه و دیتاستش متن‌باز منتشر شده و مشکل مهم ناپایداری و فراموش شدن ویرایش‌ها در ویدیوهای تولیدشده با هوش مصنوعی رو هدف گرفته. 🔖 https://ys-imtech.github.io/projects/PermaVid/

دریم‌ایکس ورلد یه مدل جدید برای ساخت دنیاهای قابل کاوش با هوش مصنوعیه که به‌جای ساخت یک ویدیوی کوتاه، یک محیط پایدار می‌سازه و می‌شه داخلش حرکت کرد، مسیر رو عوض کرد و اتفاقات جدید بهش اضافه کرد. کد و مدلش متن‌بازه و هدفش ساخت دنیای تعاملیه، نه فقط کلیپ؛ اتفاقی که می‌تونه هوش مصنوعی رو به ساخت بازی‌ها و شبیه‌سازهای واقعی نزدیک‌تر کنه. 🦖 https://amap-ml.github.io/DreamX_World/

ربات پینگ‌پنگ هوش مصنوعی سونی، «Ace»، تونست تحت قوانین رسمی ITTF بازیکن حرفه‌ای ژاپنی، Miyu Kihara را شکست بده. 🏓🤖

برخلاف خیلی از لیدربوردها، اینجا مدل‌ها روی میلیون‌ها تسک واقعی کاربران ارزیابی می‌شن؛ تسک‌هایی که نیاز به وب، ترمینال، فایل‌
+2
برخلاف خیلی از لیدربوردها، اینجا مدل‌ها روی میلیون‌ها تسک واقعی کاربران ارزیابی می‌شن؛ تسک‌هایی که نیاز به وب، ترمینال، فایل‌سیستم و اجرای چند مرحله‌ای دارند. این مدل نسبت به نسخه 5.1 از رتبه 13 به 10 رسیده و بیشترین پیشرفت را در دو بخش داشته موفقیت واقعی در انجام تسک‌ها، کاربر اهمیتی نمی‌دهد مدل چند امتیاز روی یک بنچمارک گرفته. مهم اینه که کارش انجام بشه. البته همه چیز هم عالی نیست. توانایی هدایت‌پذیری (Steerability) حدود 6 درصد افت کرده. یعنی مدل کمی بیشتر روی مسیر خودش حرکت می‌کند و شاید کنترل کردنش در بعضی سناریوها سخت‌تر از قبل باشه. اما در عوض خطای ابزار (Tool Hallucination) تقریباً بهترین عملکرد بازار را دارد. موفقیت در انجام تسک‌ها رشد قابل توجهی داشته. بازخورد مثبت کاربران جهش بزرگی کرده. نکته مهم‌تر اینه که Z.ai این مدل را با وزن‌های باز و لایسنس MIT منتشر کرده. در بازاری که هر روز مدل‌های قدرتمندتر پشت دیوارهای بسته قرار می‌گیرن، داشتن یک مدل متن‌باز که بتونه کنار Claude و Gemini و GPT رقابت کند خبر کوچکی نیست. اگر این روند ادامه پیدا کند، فاصله بین مدل‌های اوپن سورس و مدل‌های بسته سریع‌تر از چیزی که خیلی‌ها فکر می‌کنند از بین میره ‏برخلاف خیلی از لیدربوردها، اینجا مدل‌ها روی میلیون‌ها تسک واقعی کاربران ارزیابی می‌شن؛ ‏تسک‌هایی که نیاز به وب، ترمینال، فایل‌سیستم و اجرای چند مرحله‌ای دارند. ‏این مدل نسبت به نسخه 5.1 از رتبه 13 به 10 رسیده و بیشترین پیشرفت را در دو بخش داشته ‏موفقیت واقعی در انجام تسک‌ها، کاربر اهمیتی نمی‌دهد مدل چند امتیاز روی یک بنچمارک گرفته. مهم اینه که کارش انجام بشه. ‏البته همه چیز هم عالی نیست. ‏توانایی هدایت‌پذیری Steerability حدود 6 درصد افت کرده. یعنی مدل کمی بیشتر روی مسیر خودش حرکت می‌کند و شاید کنترل کردنش در بعضی سناریوها سخت‌تر از قبل باشه. ‏اما در عوض خطای ابزار (Tool Hallucination) تقریباً بهترین عملکرد بازار را دارد. ‏موفقیت در انجام تسک‌ها رشد قابل توجهی داشته. ‏بازخورد مثبت کاربران جهش بزرگی کرده. ‏نکته مهم‌تر اینه که ⁦ Z.ai⁩ این مدل را با وزن‌های باز و لایسنس MIT منتشر کرده. ‏در بازاری که هر روز مدل‌های قدرتمندتر پشت دیوارهای بسته قرار می‌گیرن، داشتن یک مدل متن‌باز که بتونه کنار Claude و Gemini و GPT رقابت کند خبر کوچکی نیست. ‏اگر این روند ادامه پیدا کند، فاصله بین مدل‌های اوپن سورس و مدل‌های بسته سریع‌تر از چیزی که خیلی‌ها فکر می‌کنند از بین میره

سهم شرکت‌های نیمه‌هادی حالا به ۱۸.۸٪ کل ارزش S&P 500 رسیده اگر هنوز فکر می‌کنی تب AI درباره چت‌بات‌هاست، پول رو دنبال کن بازا
سهم شرکت‌های نیمه‌هادی حالا به ۱۸.۸٪ کل ارزش S&P 500 رسیده اگر هنوز فکر می‌کنی تب AI درباره چت‌بات‌هاست، پول رو دنبال کن بازار دارد روی چیپ‌ها شرط می‌بنده

مسابقه جدید Reve با جایزه ۱۰۰ هزار دلاری شروع شده. بهترین مجموعه ۱۰ تصویرت را ارسال کن تا شانس برنده شدن ۱۰۰ هزار دلار را داشته باشی. https://x.com/reve/status/2067291392498679903?s=46

امکان جدید کداکس به کداکس نشون میدی چه کاری رو مرتب انجام میدی و اون رو کداکس به عنوان اسکیل ذخیره میکنه و بجات انجام میده. ‌تو این ویدیو بهش یاد میده چطور ویدیو آپلود کنه، چه تنظیم ‌هایی رو انجام بده بعد بهش فایل میده تا خودش انجام بده

گوگل یه ابزار جدید به اسم Google Vids معرفی کرده که می‌تونه اسلایدهای معمولی رو به ویدیوهای حرفه‌ای تبدیل کنه. جالبش اینجاست که یه آواتار هوش مصنوعی هم می‌تونه محتوای اسلایدها رو برات ارائه بده انگار یه نفر واقعاً داره پرزنتیشن رو توضیح می‌ده. اگه از پاورپوینت‌های خسته‌کننده خسته شدی، بد نیست یه نگاه بهش بندازی. فعلاً رایگانه https://workspace.google.com/products/vids/

‏Anthropic قابلیت جدیدی اضافه کرده که Claude Code و Claude Design حالا به‌صورت دوطرفه با هم همگام می‌شن. یعنی می‌تونی طراحی ر
‏Anthropic قابلیت جدیدی اضافه کرده که Claude Code و Claude Design حالا به‌صورت دوطرفه با هم همگام می‌شن. یعنی می‌تونی طراحی رو وارد پروژه کنی و مستقیم روی کامپوننت‌های واقعی کد بزنی، یا تغییرات کد رو دوباره به محیط طراحی برگردونی.

‏یه آپدیت از ویژولایزرم بدم ‏الان لیریک و کاور آلبوم هم میشه بهش اضافه کرد ‏رندرینگ هنوز کار داره ‏ولی خیلی جذاب شده

به نظرم مهمترین خبر امروز اینه ‏GLM-5.2 مدل جدید شرکت چینی Z .ai هست که با وزن‌های کاملاً باز (Open Weights) منتشر شده و تمرک
به نظرم مهمترین خبر امروز اینه ‏GLM-5.2 مدل جدید شرکت چینی Z .ai هست که با وزن‌های کاملاً باز (Open Weights) منتشر شده و تمرکزش روی برنامه‌نویسی، ایجنت‌های هوش مصنوعی و کارهای طولانی‌مدته. نکات مهم: در خیلی از بنچمارک‌های کدنویسی و استفاده از ابزارها، از GLM-5.1 فاصله گرفته و پیشرفت قابل توجهی داشته. از کانتکست ۱ میلیون توکنی پشتیبانی می‌کنه؛ یعنی می‌تونه حجم عظیمی از کد، اسناد و اطلاعات رو یکجا پردازش کنه. روی کارهای چندساعته و طولانی (Long-Horizon Tasks) آموزش دیده؛ یعنی برای پروژه‌های پیچیده و چندمرحله‌ای مناسب‌تره. با مجوز MIT منتشر شده؛ یعنی شرکت‌ها و توسعه‌دهنده‌ها محدودیت کمی برای استفاده ازش دارن. قیمت API نسبت به GLM-5.1 تغییری نکرده. اما بخش جالب‌تر: ‏Z .ai در نمودارها نشون داده که GLM-5.2 در بعضی تست‌های برنامه‌نویسی و Agentها به GPT-5.5، Gemini 3.1 Pro و حتی Claude Opus 4.8 نزدیک شده یا از بعضی‌ها جلو زده. اهمیت اصلی خبر اینه که فاصله بین مدل‌های متن‌باز و مدل‌های بسته مثل GPT و Claude هر روز کمتر می‌شه. اگر ادعاهای Z .ai درست باشه، GLM-5.2 یکی از جدی‌ترین رقبای متن‌باز GPT-5.5 و Opus 4.8 تا امروز محسوب می‌شه.

اسپیس‌ایکس گفته از این به بعد خبرها و اطلاعیه‌های مهمش را به‌جای خبرگزاری‌هایی مثل Business Wire و PR Newswire، مستقیم در حسا
اسپیس‌ایکس گفته از این به بعد خبرها و اطلاعیه‌های مهمش را به‌جای خبرگزاری‌هایی مثل Business Wire و PR Newswire، مستقیم در حساب رسمی خودش در X منتشر می‌کنه. طبق پرونده‌ای که به SEC داده، اکانت @SpaceX و صفحه سرمایه‌گذاران شرکت، کانال‌های رسمی اطلاع‌رسانی هستن؛ یعنی سرمایه‌گذارها باید برای خبرهای مهم SpaceX، خود X را دنبال کنن.

‏Vercel از Eve رونمایی کرده؛ یک فریم‌ورک متن‌باز برای ساخت و اجرای ایجنت‌های هوش مصنوعی. توسعه‌دهنده‌ها می‌تونن ایجنت‌هایی بسازن که کارهای پیچیده و طولانی‌مدت را به‌صورت خودکار انجام بدن، بدون اینکه از ابتدا همه زیرساخت را بسازن. https://vercel.com/blog/introducing-eve

‏Cursor یک مدل خیلی بزرگ معرفی کرده و بعضی‌ها می‌گن این خبر نشون می‌ده مدل‌های OpenAI و Anthropic آن‌قدر دور از دسترس نیستن که فقط شرکت‌های بزرگ بتونن بسازنشون. اهمیتش اینه که رقابت AI کم‌کم از چه کسی مدل بزرگ‌تری داره؟ به چه کسی بهتر می‌تونه اون رو آموزش و بهبود بده؟ تغییر کرده.

اندروید ۱۷ منتشر شد و قابلیت‌هایی مثل پنجره‌های شناور برای هر اپلیکیشن، ضبط همزمان صفحه و دوربین سلفی، حالت جدید بازی برای گو
اندروید ۱۷ منتشر شد و قابلیت‌هایی مثل پنجره‌های شناور برای هر اپلیکیشن، ضبط همزمان صفحه و دوربین سلفی، حالت جدید بازی برای گوشی‌های تاشو و امکانات امنیتی پیشرفته‌تر را اضافه کرده https://blog.google/products-and-platforms/platforms/android/android-17-features/?utm_source=tw&utm_medium=social&utm_campaign=og

گوگل قابلیت Daily Brief را به Gemini اضافه کرده؛ یک دستیار هوش مصنوعی که قبل از بیدار شدن، خلاصه‌ای شخصی از ایمیل‌ها، تقویم و کارهای مهم روز را آماده می‌کند. Gemini میخواد کم‌کم از یک چت‌بات به یک دستیار فعال و شخصی برای مدیریت روزانه تبدیل بشه. کاربرها می‌تونن با بازخورد دادن، چت مستقیم با Gemini و بررسی منابع هر مورد، این خلاصه روزانه را دقیق‌تر و شخصی‌تر کنند. https://gemini.google/overview/daily-brief/