Tensorflow(@CVision)
اخبار حوزه یادگیری عمیق و هوش مصنوعی مقالات و یافته های جدید یادگیری عمیق بینایی ماشین و پردازش تصویر TensorFlow, Keras, Deep Learning, Computer Vision سایت: http://class.vision 👨💻👩💻پشتیبان دوره ها: @classvision_support لینک گروه: @tf2keras
Ko'proq ko'rsatish📈 Telegram kanali Tensorflow(@CVision) analitikasi
Tensorflow(@CVision) (@cvision) Forsiy til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 14 979 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 8 515-o'rinni va Eron mintaqasida 22 034-o'rinni egallagan.
📊 Auditoriya ko‘rsatkichlari va dinamika
невідомо sanasidan buyon loyiha tez o‘sib, 14 979 obunachiga ega bo‘ldi.
27 Iyul, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni -22 ga, so‘nggi 24 soatda esa -9 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.
- Tasdiqlash holati: Tasdiqlanmagan
- Jalb etish (ER): Auditoriya o‘rtacha 21.25% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 10.16% ini tashkil etuvchi reaksiyalarni to‘playdi.
- Post qamrovi: Har bir post o‘rtacha 3 183 marta ko‘riladi; birinchi sutkada odatda 1 522 ta ko‘rish yig‘iladi.
- Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 18 ta reaksiya keladi.
- Tematik yo‘nalishlar: Kontent مدل, مصنوعی, llm, استدلال, مغز kabi asosiy mavzularga jamlangan.
📝 Tavsif va kontent siyosati
Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
“اخبار حوزه یادگیری عمیق و هوش مصنوعی
مقالات و یافته های جدید یادگیری عمیق
بینایی ماشین و پردازش تصویر
TensorFlow, Keras, Deep Learning, Computer Vision
سایت:
http://class.vision
👨💻👩💻پشتیبان دوره ها:
@classvision_support
لینک گروه:
@tf2kera...”
Yuqori yangilanish chastotasi (oxirgi ma’lumot 28 Iyul, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.
Ma'lumot yuklanmoqda...
| Sana | Obunachilarni jalb qilish | Esdaliklar | Kanallar | |
| 28 Iyul | 0 | |||
| 27 Iyul | 0 | |||
| 26 Iyul | +6 | |||
| 25 Iyul | +13 | |||
| 24 Iyul | +3 | |||
| 23 Iyul | 0 | |||
| 22 Iyul | +4 | |||
| 21 Iyul | 0 | |||
| 20 Iyul | +6 | |||
| 19 Iyul | 0 | |||
| 18 Iyul | 0 | |||
| 17 Iyul | +4 | |||
| 16 Iyul | 0 | |||
| 15 Iyul | +2 | |||
| 14 Iyul | 0 | |||
| 13 Iyul | 0 | |||
| 12 Iyul | 0 | |||
| 11 Iyul | +5 | |||
| 10 Iyul | +1 | |||
| 09 Iyul | +2 | |||
| 08 Iyul | +2 | |||
| 07 Iyul | +8 | |||
| 06 Iyul | +6 | |||
| 05 Iyul | +2 | |||
| 04 Iyul | +1 | |||
| 03 Iyul | 0 | |||
| 02 Iyul | +4 | |||
| 01 Iyul | +2 |
video-prompt-generator (توسعهیافته توسط Liangdabiao)
📝 درباره این ابزار: این اسکیل بر پایه یک چارچوب ۷ لایهای و حرفهای برای نوشتن پرامپتهای قدرتمند طراحی شده است. کارکرد اصلی آن، آموزش به ایجنت (Agent) برای تنظیم دقیق جزئیاتی مانند توصیفات فیزیکی، نورپردازی، ساختار چهره و فرمتهای JSON است. نتیجه این دقت، خلق تصاویر پایدار با حفظ ثبات (Consistency) در تمامی زوایا خواهد بود| 2 | در صورتی که به مدرک مکتبخونه نیاز ندارید، میتوانید کوییزها، و تمرینها و پروژهها را از طریق کانال دانلود کنید:
لینک کانال: https://t.me/agentic_llm
لینک دوره: https://mktb.me/m6tt/
هنگام خرید، کافیست گزینهی «دسترسی پایه» را تیک بزنید تا فقط به ویدیوها دسترسی داشته باشید و بتوانید با هزینهی کمتری ثبتنام کنید.
@agentic_llm | 937 |
| 3 | اگر به مدرک مکتب خونه نیازی ندارید، کوییز ها و تمرینها و پروژه را میتوانید از کانال دانلود کنید:
https://t.me/agentic_llm
لینک دوره
https://mktb.me/m6tt/ | 72 |
| 4 | نیازی نیست دوره اگر به مدرک مکتب خونه نیازی ندارید، کوییز ها و تمرینها را میتوانید از کانال دانلود کنید:
https://t.me/agentic_llm
لینک دوره
https://mktb.me/m6tt/ | 8 |
| 5 | +7 اسلایدهای دوره Agentic | 962 |
| 6 | 🤖 دوره «Agentic AI با پایتون» منتشر شد!
اگه دنبال این هستی که از حرف زدن با یه مدل زبانی، بری سراغ ساختن عاملهایی (Agent) که واقعاً کار انجام میدن، ابزار صدا میزنن، با هم تیم میشن و پروژههای واقعی رو پیش میبرن، این دوره برای شماست!
توی ۸ فصل، از صفر تا ساخت یک پروژهی نهایی کامل جلو میریم:
📘 مقدمه 📗 فصل ۱ - مقدمهای بر گردشکارهای عاملمحور 📗 فصل ۲ - الگوی طراحی Reflection 📗 فصل ۳ - استفاده از ابزار (Tool Use) 📗 فصل ۴ - MCP (پروتکل ارتباط مدل با ابزارها) 📗 فصل ۵ - نکات عملی برای ساخت Agentic AI 📗 فصل ۶ - الگوهای عاملهای با خودمختاری بالا 📗 فصل ۷ - سیستمهای چندعامله با crewAI 📗 فصل ۸ - LangChain
🎯 پروژه نهایی: پیادهسازی سامانهی Text-to-SQL
تمام کدهای دوره روی گیتهاب در دسترس است:
👉 github.com/Alireza-Akhavan/agentic_ai
🎁 تخفیف ویژه
1️⃣برای ۱۰۰ نفر اول، کد تخفیف ۷۰٪ی: COUPON-EAA61
2️⃣ برای ۱۰۰ نفر بعدی، کد تخفیف ۶۰٪ی: COUPON-6EE77
تعداد کدها محدوده، پس اگر میخواهی Agentic AI را اصولی یاد بگیری، همین امروز ثبتنام کن.
سرفصلهای این دوره |برای مشاهده اسلاید؛ تمرین، پروژه 👈 @agentic_llm | 831 |
| 7 | 🧠 مایکروسافت مدل جدید Mage-VL رو منتشر کرد؛ یک مدل چندوجهیِ «کدک-محور» برای درک ویدیو و استریم زنده
مایکروسافت دو مدل بههممرتبط رو روی HuggingFace منتشر کرده:
🔹 مدل Mage-VL — مدل چندوجهیِ ۴ میلیارد پارامتری (بر پایهی Qwen3-4B) که همزمان تصویر، ویدیوی کوتاه/بلند و استریم زنده رو درک میکنه.
🔹 مدل Mage-ViT — انکودر بصری همین مدل، که کاملاً از صفر (بدون هیچ پیشآموزش تصویر-متنِ میلیاردی) آموزش دیده.
✨ ایده
بهجای اینکه ویدیو رو به فریمهای یکنواخت تبدیل کنن و همهشون رو به مدل بدن (که پرهزینهست)، از منطق کدکهای ویدیویی (مثل H.264/HEVC) الهام گرفتن: فقط فریمهای کلیدی (I-frame) کامل نگه داشته میشن و از فریمهای پیشبینیشده (P-frame) فقط بخشهایی که واقعاً حرکت/تغییر دارن انتخاب میشن. نتیجه؟
• کاهش بیش از ۷۵٪ در تعداد توکنهای بصری
• تا ۳.۵ برابر سرعت بیشتر در inference
• آموزش روی ویدیوهایی تا ۸ برابر طولانیتر با همون بودجهی محاسباتی
📊 عملکرد:
با همون بکبون ۴B، در تقریباً همهی بنچمارکهای ویدیویی و درک مکانی از Qwen3-VL-4B جلوتره (مثلاً +۲۲.۵ در QVHighlight و +۱۱ در VSI-Bench)، و در تصاویر استاتیک همسطح یا کمی بهتره.
🎙️ یه قابلیت جالب دیگه: یک «گیت شناختی» سبک داره که مدل رو در حالت استریم فقط وقتی «رویداد قابلتوجهی» رخ بده فعال میکنه (مثلاً روی گزارش زندهی فوتبال تست شده) — بدون نیاز به چند مدل جدا.
🔗 Mage-VL: https://huggingface.co/microsoft/Mage-VL
🔗 Mage-ViT: https://huggingface.co/microsoft/Mage-ViT | 1 176 |
| 8 | مقدمه کورس Agentic AI که در روزهای پیش رو منتشر خواهد شد... | 2 286 |
| 9 | 🔥 یه خبر فوقالعاده برای دیزاینرها و تولیدکنندههای محتوا!
نسخه جدید هوش مصنوعی Qwen-Image-3.0 معرفی شد و این بار قرار نیست فقط عکسهای قشنگ تحویلمون بده!
این مدل یه ابزار کاملاً کاربردی و حرفهایه که میتونه طرحهای پیچیده و دقیق بزنه؛ از جمله: 📰 طراحی صفحات روزنامه و مجله 🎬 ساخت استوریبورد برای ویدیوها 💻 طراحی رابط کاربری (UI) وبسایت
💡 نکته جذابتر؟ از ۱۲ زبان مختلف پشتیبانی میکنه و دقتش توی درک جزئیات واقعاً بالاست.
📌 اگه دیزاینری یا محتوا میسازی، حتماً این ابزار جدید رو تست کن! | 2 467 |
| 10 | اصلاحیه: مون شات🫣 | 854 |
| 11 | 🚀 موشنشات از کیمی K3 رونمایی کرد
شرکت چینی Moonshot AI امروز قدرتمندترین مدل پرچمدار خودش، Kimi K3، رو رسما معرفی کرد.
🔹 پنجرهی زمینه تا ۱ میلیون توکن
🔹 بهبود قابلتوجه در کدنویسی، تولید سهبعدی و وظایف دانشی پیچیده
🔹 طبق برخی نشتها و تستهای کاربران، حدود ۲.۵ تریلیون پارامتر دارد (این رقم هنوز رسما تأیید نشده)
🔹 در برخی بنچمارکهای کدنویسی از GPT-5.5 جلو زده
این عرضه فقط ۳ ماه بعد از متنباز شدن K2.6 اتفاق افتاد و نشوندهندهی شتاب چشمگیر در چرخهی توسعهی موشنشاته.
💰 همزمان، موشنشات دور جدید تأمین مالی با ارزشگذاری ۲۰ میلیارد دلاری رو بسته و درآمد سالانهی خانوادهی مدلهای کیمی از ۳۰۰ میلیون دلار عبور کرده.
بازار پیشبینی Polymarket پیش از رونمایی، احتمال عرضهی K3 در جولای رو تا ۹۸٪ برآورد کرده بود.
📎 منبع: finance.biggo.com | 3 588 |
| 12 | NotebookLM is now Gemini Notebook
https://blog.google/innovation-and-ai/products/gemini-notebook/notebooklm-gemini-notebook/ | 3 550 |
| 13 | پارت ۲
2️⃣ ادغام چند متخصص RL در یک مدل (on-policy distillation):
بهجای اینکه یک مدل رو با RL روی همهچی خوب کنیم (که باعث فراموشی مهارتهای قبلی میشه)، برای هر حوزه (ریاضی، کد، ایجنت) یه معلمِ متخصص جدا با RL میسازن، بعد همه رو تو یه دانشآموز واحد distill میکنن؛ در حالی که خودِ دانشآموز داره rollout تولید میکنه. جالبه که این معلمها لزوماً بزرگتر نیستن، فقط تخصصیترن. این الگو رو DeepSeek-V4، MiMo (با نام MOPD)، GLM-5 و Nemotron 3 Ultra استفاده کردن.
3️⃣ خود مدل، معلم خودش (self-distillation):
مثل Cursor Composer 2.5 که یه hint به context اضافه میکنه، نسخهی hintدار مدل میشه معلم نسخهی بدونhint. یا روش Thinking Machines که برای جلوگیری از فراموشی، از چکپوینتِ قبل از fine-tune بهعنوان معلم استفاده میکنن.
نکتهی مشترک همهشون: معلم لزوماً بزرگتر نیست، فقط تو یه context یا حوزه بهتره. گاهی اون معلم، خودِ مدله.
🔗 منبع: huggingface.co/blog/sergiopaniego/distillation-2026 | 4 281 |
| 14 | پارت ۱
تو دورهی LLM مکتبخونه با مفهوم knowledge distillation آشنا شدیم؛ ایدهی ساده و آشنا: یه مدل معلمِ بزرگ و گرون، یه مدل دانشآموزِ کوچیکتر رو آموزش میده تا رفتارش رو تقلید کنه.
اما واقعیت اینه که این روش خیلی متنوعتره. تو پست زیر نشون میده مدلهای فرانتیر ۲۰۲۶ دقیقاً از چه نسخههایی از distillation استفاده میکنن:
1️⃣ معلم بزرگ و دانشآموز کوچیک (روش کلاسیک):
مثل Gemma 3 و DeepSeek-R1-Distill که یا روی logitهای معلم match میکنن (soft label) یا مستقیم روی متن تولیدشدهی معلم fine-tune میشن. | 3 431 |
| 15 | شرکت NVIDIA یه مجموعه داده بزرگ رایگان برای آموزش هوش مصنوعی منتشر کرده
برای اینکه یه هوش مصنوعی بتونه کارهای واقعی انجام بده (کد بزنه، خطا پیدا کنه، از ابزار استفاده کنه)، باید با هزاران نمونهی واقعی از این کارها آموزش ببینه. ولی این نمونهها کمیاب هستن و شرکتها معمولاً منتشر نمیکنند.
مثلا یه ربات که فقط با متن انگلیسی آموزش دیده، وقتی بخواد توهین رو توی زبون کرهای یا ژاپنی تشخیص بده، شکست میخوره، چرا که توی این زبونها پرخاشگری معمولاً توی «لحن مؤدبانهی ظاهری» پنهان میشه، نه توی کلمات رکیک! فلذا بدیهیست که دادهی انگلیسی به تنهایی کافی نیست.
حالا انویدیا دو تا چیز رو رایگان منتشر کرده:
📍 اولا Prompt Atlas — یه نقشهی بصری با میلیونها نمونه پرامپت واقعی (کدنویسی، ریاضی، ایمنی و...) که میتونی توش بگردی:
https://huggingface.co/spaces/nvidia/nemotron-post-training-v3-prompt-atlas
👥 ثانیا Nemotron-Personas — بیش از ۲ میلیارد «آدم مصنوعی» از ۱۰ کشور مختلف، برای تست اینکه هوش مصنوعی واقعاً فرهنگ و زبون مردمِ مناطق مختلف رو میفهمه یا نه.
🔗 مقاله:
https://huggingface.co/blog/nvidia/open-data-for-agents
#NVIDIA #هوش_مصنوعی #Nemotron | 3 723 |
| 16 | مدل SenseNova-Vision-7B-MoT از تیم SenseNova
برخلاف VLMهای معمول (مثل Qwen-VL) که فقط تصویر میگیرن و متن تولید میکنن، این مدل هم متن تولید میکنه هم تصویر — یعنی میتونه خروجیهایی مثل نقشه عمق، ماسک سگمنتیشن یا نقشه نقاط سهبعدی رو مستقیماً و بدون هد اختصاصی برای هر تسک بسازه
- تشخیص اشیا، لوکالیزیشن، OCR، گراندینگ رابط کاربری، کیپوینت
- تخمین عمق و نرمال سطح
- سگمنتیشن (رفرنسی، استدلالی، تعاملی، GCG)
- بازسازی هندسه چندنمایی و تخمین پوز دوربین
📊 عملکرد:
در مقایسه با Qwen3-VL-8B-Instruct، در اکثر تسکهای تشخیص و لوکالیزیشن جلوتره؛ مثلاً OCR (ICDAR15): ۴۹.۵ در برابر ۲۵.۴، و RefCOCOg: ~80 در برابر ~72.
البته در مقابل، توی درک عمومی تصویر (MMMU) با نمره ۰.۴۲ از Bagel (۰.۵۵) عقبتره — یعنی این مدل تخصصیِ کارهای ساختاریافته بیناییست، نه مکالمه و استدلال عمومی.
🔗 مدل در هاگینگ فیس
🔗 گیتهاب
📄 مقاله
___
@llm_huggingface
@cvision | 2 747 |
| 17 | یه وکتور دیبابیس سبک از علی بابا
https://github.com/alibaba/zvec | 3 138 |
| 18 | چند هفته پیش ضبط دورهی Agentic AI تموم شد 🎬
طبق چیزی که دوستان مکتبخونه گفتن، این دوره ۸ فصلی قراره هفته آینده روی سایت مکتبخونه منتشر بشه ✅
منتظرتون هستیم 🚀 | 3 341 |
| 19 | مدل LocateAnything از NVIDIA؛ حذف یکی از بزرگترین گلوگاههای مدلهای Vision-Language
مدل جدید LocateAnything انویدیا مشکل کندی مدلهای تشخیص اشیاء رو با یه ایده ساده و هوشمندانه حل کرده:
Parallel Box Decoding (PBD).
مسئله چی بود؟ مدلهای VLM معمولاً مختصات هر باکس (x1,y1,x2,y2) رو توکن به توکن و بهصورت متوالی تولید میکنن. وقتی صحنه پر از اشیاء باشه (مثلاً ۱۰۰ آبجکت)، این یعنی هزاران توکن قبل از رسیدن به جواب نهایی! هم کند، هم چون مختصات یک باکس مستقل از هم پیشبینی میشن، کاهش دقت هندسی.
راهحل PBD: کل باکس بهعنوان یک واحد اتمیک (block) با طول ثابت در یک گام موازی پیشبینی میشه، نه توکن به توکن. این کار همزمانی همونقدر که سرعت رو بالا میبره، دقت رو هم بهتر میکنه چون چهار مختصه با آگاهی از هم پیشبینی میشن (نه کور و مستقل).
📄 مقاله:
https://research.nvidia.com/labs/lpr/locate-anything/LocateAnything.pdf
🌐 پروژه:
https://research.nvidia.com/labs/lpr/locate-anything/
💻 دمو :
https://huggingface.co/spaces/nvidia/LocateAnything
🤗مدل:
https://huggingface.co/spaces/nvidia/LocateAnything | 3 639 |
| 20 | یه بنده خدایی یه پرامپت را آزمایش کرده و اعلام کرده که Fable 5 تو رقابت جدیدمون کامل بقیه رو داغون کرد، ولی ۶ برابر گرونتر از Opus 4.8 تموم شد!
به ۴ مدل یه پرامپت یکسان داده: ساخت سه تا صحنه مستقل با HTML5 canvas و فیزیک واقعی
پرامپتها:
خارج شدن قطار از ریل روی یه پل شکسته و سقوط تو آب
پرش دو ماشین از سکو و برخورد تو هوا روی یه دره
له کردن یه ردیف ماشین پارکشده توسط مونستر تراک
خروجیها:
Fable 5: ۶۲,۱۵۸ توکن، $۳.۱۲
GPT 5.5: ۳۷,۷۵۳ توکن، $۱.۱۴
Opus 4.8: ۲۲,۲۸۰ توکن، $۰.۵۶
GLM 5.2: ۳۶,۲۴۶ توکن، $۰.۰۸
مدل Fable 5 هر سه صحنه رو با نمره A+ رد کرد. برخوردها واقعی بهنظر میرسیدن، اشیاء درست میافتادن و میشکستن، و هیچچیز از داخل زمین رد نمیشد یا معلق نمیموند.
مدل GPT 5.5 نزدیکترین رقیب به Fable بود. تو صحنهی Bigfoot حتی بهنظرمون یهکم از Fable بهتر بود.
مدل GLM 5.2 تو هیچ صحنهای برنده نشد، ولی بهمراتب ارزونترین بود.
منبع: https://twitter.com/atomic_chat_hq/status/2072446067962978411 | 4 019 |
