آموزش LLM و VLM
Open in Telegram
2 421
Subscribers
No data24 hours
No data7 days
No data30 days
Posts Archive
2 421
استفاده از فرمت مناسب داده برای کاهش توکن ها!
آیا TOON هزینه استفاده از LLM شما را کم میکند؟ بله امانه همیشه!
سوالی که خیلی پرسیده میشه اینه که آیا TOON نسبت به Json توکن کمتری مصرف میکند؟
جواب کوتاه: در بسیاری از جدولها، ۳۰–۶۰٪ کمتر!
اما سؤال واقعی برای مهندسین AI این است:
دادههایتان جدولی هستند یا درختی؟ TOON در جدولهای بزرگ و تکراری عالی است، اما در JSON پیچیده ممکن است نتیجه معکوس بدهد.
آیا مشکل فرمت دارید یا معماری سیستم؟ اگر هنوز همه دادهها را به مدل میفرستید، انتخاب فرمت فقط یک بهینهسازی جزئی است.
💡 نکته اصلی:
دادههای درختی → JSON
دادههای مسطح و تحلیلی → CSV
پرامپتهای LLM با جدولهای بزرگ و تکراری → TOON
امروزه، فرمت داده بخشی از پرامپت انجینیرینگ است، نه فقط پسوند فایل!
https://github.com/toon-format/toon
2 421
این کد تخفیف به تعداد محدود و به مدت 3 روز روی دوره جدید فعال است
70 درصدی:
COUPON-52f8c
2 421
به زودی تعداد کد تخفیف ۷۰ درصد برای نفرات اول که ثبت نام میکنند نیز در کانال قرار گرفته میشه نهایتاً تا یک ساعت آینده
2 421
🎓 مینی دوره: ساخت هوش مصنوعی شخصی در مرورگر
تو این مینی دوره یاد میگیری چطور یک Local LLM و حتی VLM رو مستقیم تو مرورگر اجرا و شخصیسازی کنی—بدون نیاز به سرور، پردازش ابری، فریمورک یا لایبری اضافی!
💡 آنچه یاد میگیرید:
اصول پایهای جاوااسکریپت برای کار با مدلهای AI در مرورگر
اجرای Local LLM در مرورگر
کار با Prompt API برای مدیریت و کنترل پاسخهای مدل
شخصیسازی خروجی با Initial Prompts و JSON Schema
پیادهسازی VLM برای تحلیل تصاویر داخل Google
📌 سرفصلها:
Setup اولیه Local LLM در مرورگر
شروع کار با Prompt API
نکات تکمیلی Prompt API
Prompt Streaming یا پاسخدهی همزمان Local LLM
Aborting یا متوقف کردن پاسخدهی Local LLM
Session Clone یا پاک کردن حافظه Local LLM
اختصاصیسازی خروجی با Initial Prompts
اختصاصیسازی خروجی با JSON Schema
پیادهسازی VLM یا تحلیل تصاویر در Google Chrome
سایر APIها و راهنمای ادامه مسیر
🚀 آمادهای مهارتت در ساخت هوش مصنوعی شخصی رو یک پله بالاتر ببری؟
https://mktb.me/5kkw/
کد تخفیف 60 درصدی ویژه انتشار مینی دوره:
COUPON-35715سایت دوره: https://jsai.ir/
2 421
این یکی از خفنترین دموهای Hugging Face توی این روزهاست: «کنترل دوربین» که با LoRA روی مدل Qwen Image Edit آموزش داده شده 🤯
👀 چی کار میکنه؟
کافیه یه تصویر آپلود کنی، بعد میتونی با چند تا کلیک، زاویه دوربین رو عوض کنی و یه صحنه کاملاً جدید بسازی!
از چرخوندن دوربین به چپ و راست گرفته تا جلو رفتن، زوم کردن، یا حتی تغییر زاویه نگاه از دید پرنده تا دید کرم (bird’s-eye / worm’s-eye) – همهش با یه کلیک!
🎯 این یعنی چی؟
یه ویژگی بینظیر اضافه شده: کنترل کامل زاویه دوربین توی مدلهای ویرایش تصویر.
یه چیزی که حتی Google Nano Banana هنوز نداره!
🔧 LoRA چیه؟
LoRA یا Low-Rank Adaptation یه تکنیکیه که فقط بخش کوچیکی از پارامترهای مدل رو آموزش میده، بدون اینکه کل مدل از صفر آموزش داده بشه.
اینجا هم LoRA روی مدل Qwen Image Edit سوار شده و بهش قابلیت کنترل دوربین داده – بدون نیاز به آموزش دوباره کل مدل.
⚡️ نکته باحال:
این پروژه از نسخهای بهینه به نام Rapid-AIO استفاده میکنه که سرعت پردازش رو خیلی بالا برده — خروجی رو فقط تو چهار مرحله میگیری!
پست مرتبط در توئیتر | دمو در هاگینگ فیس
2 421
🔥🚀 یه اتفاق بزرگ تو دنیای وب و هوش مصنوعی در راهه!
همین هفته یه مینیدوره فوقالعاده منتشر میشه که قراره دنیای ساخت اپهای هوش مصنوعی تو مرورگر رو برات باز کنه!
🎯 فقط با ۵ خط جاوااسکریپت ساده، بدون هیچ فریمورک یا کتابخونه خارجی، بدون سرور و حتی کاملاً آفلاین! 😱
📦 این دوره تمرکزش روی PromptAPI + SLMها (مدلهای زبان کوچیک اما قدرتمند) تو مرورگره — چیزی که تازه داره به Chrome و Edge اضافه میشه و قراره صنعت وب رو زیر و رو کنه!
🧠 مناسب برای کیه؟
🔹 اگر قبلاً پایتون یا یه زبان دیگه کار کردی و جاوااسکریپت برات جدیدتره — نگران نباش! یه فصل 0 (مقدمهی JS) مخصوص تو داریم 🧩
🔹 اگر جاوااسکریپت بلدی — مستقیم میپری تو دل ماجرا و با ساخت یه عالمه اپ خفن شروع میکنی!
🎬 محتوای دوره:
⏰ کل دوره: فقط ۳ ساعت!
📌 مرورگرها بهصورت نیتیو LLM دارن
📌 بدون سرور، بدون Backend — همهچی روی سیستم کاربر
📌 Privacy اولویت اصلی
📌 واقعاً استاندارد شده و آیندهدار
💡 چرا این دوره حیاتیه؟
چون از این به بعد اپهای هوش مصنوعی، بدون سرور هم میتونن ساخته بشن
هر کسی با کمترین دانش برنامهنویسی میتونه وارد بازی بشه
اگر وب کار هستی و اینو ندونی… عقب میمونی
اگر وب کار نیستی هم عاشقش میشی چون به معنی واقعی کلمه فقط با یک فایل index.html میتونی یه مدل زبان داشته باشی 🤯
🥁 منتظر اطلاعرسانی انتشار دوره باشید...
2 421
Repost from Tensorflow(@CVision)
🧠 Gemini 2.5 Computer Use
هوش مصنوعی پشت موس و کیبورد!
گوگل دیپمایند مدل جدیدی از خانواده Gemini معرفی کرده که میتونه مستقیماً با رابطهای کاربری کار کنه، یعنی خودش کلیک کنه، تایپ کنه، اسکرول کنه و از طریق مرورگر یا موبایل، کاربر رو در محیط واقعی نرمافزار شبیهسازی کنه.
این مدل با ابزار جدید computer_use در Gemini API عرضه شده و با دریافت اسکرینشات و دستور کاربر، اقدام بعدی رو پیشبینی میکنه. فعلاً تمرکز روی کنترل مرورگر و اپهای موبایل هست، اما بهزودی دامنهاش گستردهتر میشه.
💡 در بنچمارکهای Web و Android، Gemini 2.5 عملکرد بهتری از مدلهای قبلی نشون داده و از نظر ایمنی هم سیستم تأیید اقدامات حساس رو داره.
🔧 فعلاً در مرحلهی پیشنمایش (Preview) از طریق Google AI Studio و Vertex AI در دسترسه.
📎 جزئیات بیشتر در وبلاگ رسمی گوگل:
🔗 blog.google 🔗
🌀 @cvision 🌀
2 421
🎉🎂 تولد ۹ سالگی کانال Tensorflow مبارک! 🎂🎉
به مناسبت این اتفاق خاص، براتون یه تخفیف فوقالعاده در نظر گرفتیم 👇
🔥 ۷۰٪ تخفیف روی همه دورهها
💥 و ۱۰۰٪ تخفیف (رایگان!) برای دوره یادگیری ماشین
📚 دورهها در مکتبخونه:
* 🤖 دوره یادگیری ماشین — کد تخفیف:
happy9-ml
* 🧠 دوره دیپلرنینگ — کد تخفیف: happy9-dl
* 🦙 دوره LLM — کد تخفیف: happy9-llm
* 👁 دوره OpenCV — کد تخفیف: happy9-opencv
* 📸 دوره Vision-Language Models (VLM) — کد تخفیف: happy9-vlm
🎓 همچنین تمامی دورههای کلاسویژن (از مقدمات تا GNN!)
در دسترس شماست با ۷۰٪ تخفیف
🔗 https://class.vision/
کد تخفیف: haapy9
⏰ فقط تا 22 آبان! فرصت رو از دست نده و با این تخفیف ویژه شروع کن 🚀2 421
👈 برترین کانالهای آموزشی در زمینه های هوشمصنوعی, پایتون و یادگیری ماشین و علم داده
⭐️ معرفی دوره های رایگان AI, ML, LLM و DataScience
👉 @Ai_Tv
⭐️مجله هوشمصنوعی
👉 @Homeai
⭐️ یادگیری عمیق و هوش مصنوعی
👉 @cvision
⭐️ آموزشهای تخصصی هوش مصنوعی
👉 @class_vision
⭐️ دورههای تخصصی LLM ،VLM و Agentic AI
👉 @llm_huggingface
⭐️رویدادهای هوشمصنوعی
👉 @eventai
⭐️آموزش Machine Learning
👉 @Machine_learn
⭐️آموزش علوم داده
👉 @DataPlusScience
⭐️آموزش ، اخبار و تحولات هوشمصنوعی
👉 @Ai_NewsTv
⭐️ دوره های رایگان Python , ML و Ai از موسسات معتبر
👉 @Python4all_pro
⭐️منابع آموزشی پایتون برای علم داده ،ML & Ai :
👉 @programmers_street
2 421
🎉🎂 تولد ۹ سالگی کانال Tensorflow مبارک! 🎂🎉
به مناسبت این اتفاق خاص، براتون یه تخفیف فوقالعاده در نظر گرفتیم 👇
🔥 ۷۰٪ تخفیف روی همه دورهها
💥 و ۱۰۰٪ تخفیف (رایگان!) برای دوره یادگیری ماشین
📚 دورهها در مکتبخونه:
* 🤖 دوره یادگیری ماشین — کد تخفیف:
happy9-ml
* 🧠 دوره دیپلرنینگ — کد تخفیف: happy9-dl
* 🦙 دوره LLM — کد تخفیف: happy9-llm
* 👁 دوره OpenCV — کد تخفیف: happy9-opencv
* 📸 دوره Vision-Language Models (VLM) — کد تخفیف: happy9-vlm
🎓 همچنین تمامی دورههای کلاسویژن (از مقدمات تا GNN!)
در دسترس شماست با ۷۰٪ تخفیف
🔗 https://class.vision/
کد تخفیف: haapy9
⏰ فقط تا 22 آبان! فرصت رو از دست نده و با این تخفیف ویژه شروع کن 🚀2 421
Repost from Tensorflow(@CVision)
🎉 فقط ۳ روز دیگه (۴ نوامبر) تولد ۹ سالگی کاناله!
به همین مناسبت، تخفیفهای ویژه روی همه دورهها در راهه 😍
هم دورههای کلاسویژن و هم مکتبخونه 🔥
منتظر باشید! 💫
2 421
اینم یکی تو نظرات پست قبلی معرفی کرده
AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning
https://autovla.github.io/
2 421
مدلهای VLM (Vision-Language Model) فقط تصویر و زبان رو ترکیب میکنن و هدفشون درک یا توضیح صحنههاست.
اما VLA (Vision-Language-Action)ها یه قدم جلوترن — اونها علاوه بر دیدن و فهمیدن، اقدام هم میکنن؛ یعنی میتونن در محیط واقعی تصمیم بگیرن و عمل کنن.
🔹 تازهترین نمونه این دسته، مدل GigaBrain-0 هست:
مدلی پایهای برای رباتهای هوشمند که با استفاده از دادههای ساختهشده توسط world model (مثل ویدیوهای مصنوعی، انتقال از انسان یا شبیهساز به واقعیت) یاد میگیره.
به لطف این روش، دیگه لازم نیست حجم زیادی داده واقعی از رباتها جمعآوری بشه.
📈 نتیجه:
تعمیم بهتر بین وظایف مختلف
عملکرد قویتر در کارهای پیچیده و بلندمدت
تصمیمگیری پایدارتر
نسخه سبکترش، GigaBrain-0-Small هم برای سختافزارهایی مثل NVIDIA Jetson AGX Orin بهینه شده.
💡 خلاصه: GigaBrain-0 گام بزرگیه به سمت رباتهایی که مثل انسان میبینن، میفهمن و عمل میکنن.
https://huggingface.co/open-gigaai
2 421
Liquid AI's LFM2-VL-3B Brings a 3B Parameter Vision Language Model (VLM) to Edge-Class Devices - MarkTechPost https://www.marktechpost.com/2025/10/24/liquid-ais-lfm2-vl-3b-brings-a-3b-parameter-vision-language-model-vlm-to-edge-class-devices/
2 421
🚀 Supercharge your OCR Pipelines with Open Models
📚 تیم Hugging Face توی آخرین بلاگش یه مرور عالی روی مدلهای open-source OCR منتشر کرده.
از مدلهای معروف مثل PaddleOCR گرفته تا مدلهای جدیدتر مثل OlmOCR و Chandra،
همه بررسی شدن و نشون داده شده چطور میشه با fine-tune یا ترکیب Vision-Language Modelها
به دقت بالاتر و performance بهتر رسید.
💡 اگر روی taskهایی مثل document understanding، table extraction یا visual QA کار میکنین،
این پست پر از insightهای کاربردی برای انتخاب و deploy مدلهای مناسب هست.
📎 لینک مطلب:
👉 huggingface.co/blog/ocr-open-models
2 421
پروژه یکی از دوستان عضو کانال:
https://github.com/amirhoseinnaderali-pixel/AutoTune-Research-Assistan
لازم نیست دیگه وقتت رو صرف خواندن راجب مدل بکنی و دیتاست و پیچیدگیهای کار،Auto tuneهوش مصنوعی که برای فاینتیونینگ فکر میکنه! یه دستیار هوشمند مخصوص پژوهشگرها، دولوپرها و علاقهمندان هوش مصنوعیه که بهت کمک میکنه بهترین مدلها، دیتاستها و استراتژیها رو برای پروژه فاینتیونینگت پیدا کنی. کافیه فقط توضیح بدی چی میخوای انجام بدی — AutoTune خودش همهچی رو برات پیدا میکنه: 🔍 میگرده توی HuggingFace، ArXiv و Kaggle 🧠 نیازت رو با تحلیل هوشمند تشخیص میده 📊 یه گزارش پژوهشی کامل با پیشنهاد مدل و دیتاست برات میسازه 🎯 و حتی مسیر اجرای پروژهت رو قدمبهقدم مشخص میکنه! با AutoTune، فقط حرف بزن… و بقیهش رو بسپار به هوش مصنوعی 💬🤖
2 421
Repost from Tensorflow(@CVision)
تبدیل PDF از اسلایدها (عکس) به PowerPoint با هوش مصنوعی
یه اسکریپت جالب نوشتم که هنوز کامل نیست ولی خیلی به دردم خورد! 💡
🎯 چیکار میکنه؟
یه فایل PDF از اسلایدها میگیره و با کمک DeepSeek-OCR با حفظ مکان عنوانها، عکسها و بقیه المانها، یه PowerPoint کامل بهتون تحویل میده!
🔗 گیتهاب: github.com/Alireza-Akhavan/pdf_to_ppt_with_deepseekocr
📹 یه کیس واقعی ازش استفاده کردم:
کل ویدیوهای کورس Agentic از Andrew Ng رو پردازش کردم:
✅ با ffmpeg فقط فریمهایی که تغییر داشتن رو سیو کردم
✅ با OpenCV فریمهایی که چهره Andrew بود رو حذف کردم
✅ اسلایدهایی که مرحله به مرحله کامل میشدن رو یکی کردم
✅ همه رو تبدیل به یه PDF کردم
✅ با DeepSeek-OCR تبدیل به Markdown و JSON (موقعیتها) شد
✅ با python-pptx همه چیز رو سر جاش گذاشتم و یه PPT درست کردم
📦 چی تو گیتهاب هست؟
فرآیند از PDF به بعد رو آپلود کردم. اگه علاقه دارید کاملش کنید یا ایده بدید، خوشحال میشم! 🙌
من میخواستم کار خودمو راه بندازم و خیلی روش وقت نذاشتم. اما با صرف وقت و سلیقه، قشنگ میشه یه محصول خفن ازش ساخت...
https://github.com/Alireza-Akhavan/pdf_to_ppt_with_deepseekocr
2 421
Repost from Tensorflow(@CVision)
تبدیل PDF از اسلایدها (عکس) به PowerPoint با هوش مصنوعی
یه اسکریپت جالب نوشتم که هنوز کامل نیست ولی خیلی به دردم خورد! 💡
🎯 چیکار میکنه؟
یه فایل PDF از اسلایدها میگیره و با کمک DeepSeek-OCR با حفظ مکان عنوانها، عکسها و بقیه المانها، یه PowerPoint کامل بهتون تحویل میده!
🔗 گیتهاب: github.com/Alireza-Akhavan/pdf_to_ppt_with_deepseekocr
📹 یه کیس واقعی ازش استفاده کردم:
کل ویدیوهای کورس Agentic از Andrew Ng رو پردازش کردم:
✅ با ffmpeg فقط فریمهایی که تغییر داشتن رو سیو کردم
✅ با OpenCV فریمهایی که چهره Andrew بود رو حذف کردم
✅ اسلایدهایی که مرحله به مرحله کامل میشدن رو یکی کردم
✅ همه رو تبدیل به یه PDF کردم
✅ با DeepSeek-OCR تبدیل به Markdown و JSON (موقعیتها) شد
✅ با python-pptx همه چیز رو سر جاش گذاشتم و یه PPT درست کردم
📦 چی تو گیتهاب هست؟
فرآیند از PDF به بعد رو آپلود کردم. اگه علاقه دارید کاملش کنید یا ایده بدید، خوشحال میشم! 🙌
من میخواستم کار خودمو راه بندازم و خیلی روش وقت نذاشتم. اما با صرف وقت و سلیقه، قشنگ میشه یه محصول خفن ازش ساخت...
https://github.com/Alireza-Akhavan/pdf_to_ppt_with_deepseekocr
