fa
Feedback
دستاوردهای یادگیری عمیق(InTec)

دستاوردهای یادگیری عمیق(InTec)

رفتن به کانال در Telegram

هوش مصنوعی، یادگیری ماشین و یادگیری عمیق موضوع اصلی کانال این یک بلاگ شخصی با طرز تفکر شخصی هست. Core Python : @PyHints تلاشی هم در یادگیری Rust دارم که درحال داکیومنت شدن هم هست؛ اگر شماهم به این زبان علاقمند هستید join یادتون نره Rust: @PyRust

نمایش بیشتر
9 872
مشترکین
+324 ساعت
+207 روز
+8430 روز

در حال بارگیری داده...

جذب مشترکین
سپتامبر '26
سپتامبر '26
+110
در 4 کانال‌ها
اوت '26
+155
در 0 کانال‌ها
Get PRO
ژوئیه '26
+168
در 2 کانال‌ها
Get PRO
ژوئن '26
+178
در 2 کانال‌ها
Get PRO
مه '26
+114
در 2 کانال‌ها
Get PRO
آوریل '26
+36
در 0 کانال‌ها
Get PRO
مارس '26
+16
در 0 کانال‌ها
Get PRO
فوریه '26
+93
در 1 کانال‌ها
Get PRO
ژانویه '26
+148
در 2 کانال‌ها
Get PRO
دسامبر '25
+100
در 1 کانال‌ها
Get PRO
نوامبر '25
+100
در 2 کانال‌ها
Get PRO
اکتبر '25
+122
در 0 کانال‌ها
Get PRO
سپتامبر '25
+204
در 0 کانال‌ها
Get PRO
اوت '25
+234
در 2 کانال‌ها
Get PRO
ژوئیه '25
+156
در 5 کانال‌ها
Get PRO
ژوئن '25
+196
در 2 کانال‌ها
Get PRO
مه '25
+204
در 3 کانال‌ها
Get PRO
آوریل '25
+227
در 4 کانال‌ها
Get PRO
مارس '25
+287
در 4 کانال‌ها
Get PRO
فوریه '25
+256
در 2 کانال‌ها
Get PRO
ژانویه '25
+197
در 1 کانال‌ها
Get PRO
دسامبر '24
+252
در 3 کانال‌ها
Get PRO
نوامبر '24
+310
در 1 کانال‌ها
Get PRO
اکتبر '24
+366
در 4 کانال‌ها
Get PRO
سپتامبر '24
+362
در 3 کانال‌ها
Get PRO
اوت '24
+363
در 0 کانال‌ها
Get PRO
ژوئیه '24
+525
در 3 کانال‌ها
Get PRO
ژوئن '24
+422
در 2 کانال‌ها
Get PRO
مه '24
+404
در 2 کانال‌ها
Get PRO
آوریل '24
+647
در 8 کانال‌ها
Get PRO
مارس '24
+458
در 1 کانال‌ها
Get PRO
فوریه '24
+325
در 2 کانال‌ها
Get PRO
ژانویه '24
+273
در 1 کانال‌ها
Get PRO
دسامبر '23
+386
در 4 کانال‌ها
Get PRO
نوامبر '23
+47
در 2 کانال‌ها
Get PRO
اکتبر '23
+40
در 0 کانال‌ها
Get PRO
سپتامبر '23
+114
در 0 کانال‌ها
Get PRO
اوت '23
+112
در 0 کانال‌ها
Get PRO
ژوئیه '23
+102
در 0 کانال‌ها
Get PRO
ژوئن '23
+216
در 0 کانال‌ها
Get PRO
مه '23
+112
در 0 کانال‌ها
Get PRO
آوریل '23
+156
در 0 کانال‌ها
Get PRO
مارس '23
+110
در 0 کانال‌ها
Get PRO
فوریه '23
+235
در 0 کانال‌ها
Get PRO
ژانویه '23
+259
در 0 کانال‌ها
Get PRO
دسامبر '22
+125
در 0 کانال‌ها
Get PRO
نوامبر '22
+95
در 0 کانال‌ها
Get PRO
اکتبر '22
+134
در 0 کانال‌ها
Get PRO
سپتامبر '22
+186
در 0 کانال‌ها
Get PRO
اوت '22
+113
در 0 کانال‌ها
Get PRO
ژوئیه '22
+104
در 0 کانال‌ها
Get PRO
ژوئن '22
+95
در 0 کانال‌ها
Get PRO
مه '22
+95
در 0 کانال‌ها
Get PRO
آوریل '22
+113
در 0 کانال‌ها
Get PRO
مارس '22
+163
در 0 کانال‌ها
Get PRO
فوریه '22
+67
در 0 کانال‌ها
Get PRO
ژانویه '22
+80
در 0 کانال‌ها
Get PRO
دسامبر '21
+45
در 0 کانال‌ها
Get PRO
نوامبر '21
+101
در 0 کانال‌ها
Get PRO
اکتبر '21
+28
در 0 کانال‌ها
Get PRO
سپتامبر '21
+63
در 0 کانال‌ها
Get PRO
اوت '21
+174
در 0 کانال‌ها
Get PRO
ژوئیه '21
+42
در 0 کانال‌ها
Get PRO
ژوئن '21
+35
در 0 کانال‌ها
Get PRO
مه '21
+40
در 0 کانال‌ها
Get PRO
آوریل '21
+24
در 0 کانال‌ها
Get PRO
مارس '21
+38
در 0 کانال‌ها
Get PRO
فوریه '21
+116
در 0 کانال‌ها
Get PRO
ژانویه '21
+76
در 0 کانال‌ها
Get PRO
دسامبر '20
+1 830
در 0 کانال‌ها
تاریخ
رشد مشترکین
اشارات
کانال‌ها
16 سپتامبر+4
15 سپتامبر+4
14 سپتامبر+7
13 سپتامبر+19
12 سپتامبر+3
11 سپتامبر+2
10 سپتامبر+5
09 سپتامبر+1
08 سپتامبر+8
07 سپتامبر+5
06 سپتامبر+16
05 سپتامبر+25
04 سپتامبر+3
03 سپتامبر+4
02 سپتامبر+2
01 سپتامبر+2
پست‌های کانال
حالا که به این موضوع علاقه‌مند شدید باید بگم که؛ جاندارانی با مغز بزرگتر هم توی صف هستند برای این تحقیقات.

2
گوگل مغز یک حشره رو مپ کرده و بصورت open source هم منتشرش کرده تا اینجا یک کار تحقیقاتی هست. بعد یک سری آدم اومدند؛ این حشره رو توی کارهای مختلف شبیه‌سازی کردند حشره توی بازی‌های مختلف حشره توی دنیای کریپتو حشره توی معاملات بورسی و ... بعضی‌هاش واقعا نتایج جالبی داره و ایده‌های خنده‌دار هم توش بسیار بسیار زیاده. Google Research Github
2 210
3
این داستان رو قدیما سر آموزش‌های مربوط به دیتاساینس تعریف می‌کردم. اهمیت train/test split یادش بخیر
1 873
4
دلیل اینکه راجب حل مسئله‌ی Navier-Stokes چیزی ننوشتم این بود که گفته‌های OpenAI رو باور نداشتم. چرا ؟ اونایی که از قبل من رو می‌شناسند می‌دونند من علاقه‌ای هم به فیزیک دارم (شاید متوجهش نشم ولی بهش علاقه دارم و دنبال می‌کنم) مسائل زیادی اونجا بهینه‌سازی یا حل شده توی ۱ سال اخیر و با کمک AI اما توی تمام موارد نقش AI استفاده از ترکیب‌های متفاوت فرمول‌ها بوده و یک فیزیکدان پشت داستان بوده. دلیل اصلی که هیچکدوم از شرکت‌های AI هم روش مانور نمیدن همین هست که چیزی برای اون‌ها نداره. تکنیکی که استفاده می‌شه هم مثل روشی هست که باعث کشف Neptune شد Urbain Le Verrier, who calculated the predicted position of Neptune. داستان پشت Open AI هم بنظر میاد همین باشه؛‌ agent‌ها از دیتای دو نفر ریاضیدان استفاده کردند که دقیقا داشتند روی این مسئله کار می‌کردند و بسیار هم پیشرفت داشتند. با توجه به چیزهایی که من توی ۱ سال گذشته توی کامیونیتی فیزیک دیدم؛ کاملا حرف ریاضیدان‌ها رو قبول می‌کنم. More on Youtube
1 310
5
تقریبا می‌تونم بگم تمام بنچمارک‌های معروف هوش مصنوعی از رده خارج شده حساب میشه مثلا توی یکی از موارد Artificial Analysis رسما (توییتر) قبول کرد که بنچمارک‌هاش قدیمی شده و اکثر مواردی که داره مربوط به چالش بسیار قدیمی needle in haystack هست یا مواردی توی بنچمارک‌های software engineering هم من گزارشاتی خوندم که بیشتر تسک‌هاشون برای Frontend, 3D و پیشرفت‌های اخیر مدل‌ها رو ببینید؛‌ اکثرا دارند توی Game development, Frontend و ... تست میشوند روی یوتیوب و همه‌ی اون‌هایی که توی این تسک‌ها نتایج خوبی داشتند توی بنچمارک‌های معروف هم بسیار خوب عمل‌ می‌کنند. توی همون تسک خوندن لاگ و پیدا کردن مشکل مجبور شدم یک سری کد بزنم که کارم رو سریعتر کنم https://t.me/per3onnel/629 شاید باورتون نشه ولی gemini 3.6 Flash (Fast) بهترین نتایج رو بهم میداد من همیشه مدل‌ها رو با کدهای خودم تست می‌کنم الان چندسال هست و بنظرم توی زمان حال شما هم باید همین کار رو انجام بدید؛ خیلی از مدل‌هایی که از نظر بنچمارک‌ها rank بالا می‌گیرند ممکنه برای کار شما اصلا مناسب نباشه و برعکس این موضوع هم هست. چطوری بنچمارک خودتون رو بسازید (من اینطوری ساختم) : یک کد یا تسک یا کانفیگ دارم که مشکل داره و درست کار نمی‌کنه به مدل‌های هوش مصنوعی موجود میدم و جواب‌ها رو بررسی می‌کنم ولی هیچکدوم جواب درست رو نمیده این رو ذخیره میکنم کد/کانفیگ اشتباه رو + پرامپت رو بعنوان ورودی برای تست ذخیره می‌کنم. وقتی بعد از چندساعت به راه حل رسیدم اون راه حل رو هم ذخیره می‌کنم (خلاصه شده و تمیز شده فقط راه حل رو بدون توضیحات) چندماه بعد که مدل جدیدی معرفی میشه همین کار رو تکرار می‌کنم؛ امتیاز مدل رو می‌نویسم :‌ مثلا از ۳۰ تا سوال چندتارو درست جواب داده - جندتا رو جوابی که داده راهنمای خوبی برای رسیدن به راه حل و درک مشکل هست ولی جواب نهاییش درست نیست - چندتارو کاملا گمراه کننده جواب داده و اینکه برای هیچ مدلی پرامپت ورودی رو تغییر نمیدم؛ این استاندارد پرامپت نویسی منه شاید مدل خیلی خفن باشه ولی اگر پرامپت ذخیره شده من نتونه ازش جواب بگیره احتمال اینکه موقع استفاده من بتونم از اون مدل جواب بگیرم هم خیلی پایین هست (چون من به این تکنیک پرامپت نوشتن عادت کردم) اینکار رو بنظرم هرکسی که بیش از روزانه ۱ ساعت از LLM برای کد نویسی یا حل مشکلات فنی استفاده می‌کنه باید انجام بده؛ بخصوص اینکه ۹۰٪ یوتیوبرها برای بنچمارک دارند از تسک‌های دارای گرافیک استفاده می‌کنند چون بازدید این‌ها بیشتر هست. من یوتیوبری رو نمیشناسم که مثلا بیاد پیاده‌سازی یک سرویس بکند (جدید نه چیزی که هزاران کد براش توی گیت‌هاب هست) یا پیاده سازی driver یا embed system رو تست کنه چون این موارد بازدید نداره ولی احتمالا شغل اکثر شمایی که عضو این کانال هستید به این موارد بستگی داره. برای خودم واقعا شکه کننده بود که gemini 3.6 flash (fast) تمام کدهایی که ازش میخواستم روی توی همون بار اول درست تحویل میداد (البته من خیلی می‌شکوندم تسک رو و با جزئیات بهش می‌گفتم چطوری باید باشه) ولی این مدل حتی توی ۳۰ مدل اول DeepSWE هم نیست و انقدر هم سریع خروجی بهتون میده که سرعت برنامه‌نویسی شما رو اصلا کم نمی‌کنه. تنها مشکلی که من دیدم: توی پروژه بزرگتر حتما باید خودتون بعدش refactor کنید.
1 492
6
چون به این علاقه داشتید و share کردید (بیش از ۴۰۰ بار)‌ گفتم براتون یک آموزش دیگه هم بذارم؛ این یکی برای اون‌هایی که به deep learning علاقه‌دارند تازه شروع کردند یا می‌خوان شروع کنند و مباحث زیاد هست و پیش‌نیازها بیشتر. Carnegie Mellon University Deep Learning من این کانال رو چندسالی هست که خودم دنبال می‌کنم؛ همینجا بگم که بهترین لهجه انگلیسی توی این کانال نیست اما یک نگاهی به ویدئوهای اخیرشون برای دوره Intro to deep learning Fall 2026 بندازیم (تایتل‌ها)‌ 0.1 Python Fundamentals 0.2 OOP 0.3 Numpy 0.4 Pytorch 0.5 Notebooks and conda 0.6 Tensordot & Einsum 0.7 Differentiation/Calculus Part 1 0.7 Differentiation/Calculus Part 2 0.8 Git and Github 0.9 Google colab 0.10 Google cloud 0.11 Kaggle ... 0.14 Linux 0.15 Datasets 0.16 DataLoaders 0.17 Data Preprocessing 0.18 Wandb 0.19 Debugging your model 0.21 Losses 0.22 Block processing 0.23 Pipelines 0.24 Distributed training 0.25 Saving and loading model همونطوری که می‌بینید از صفر می‌تونید شروع کنید؛ می‌خواید خیلی قوی بشید ؟ تمرین‌های دورهای قبلی رو حل کنید (خودشون هم حلش رو گذاشتن) موضوعی هم می‌تونید توی کانال سرچ کنید و مباحث رو پیدا کنید من هیچ دوره‌ای رو ندیدم انقدر سرفصل‌های کاملی داشته باشه؛ فقط یک دوره رو ببیند و تمرینات دوره‌های قبلی رو حل کنید بعدش شروع کنید پروژه زدن؛ کل این دوره‌ها هم رایگان هست. وقتی پیش نیازها تموم بشه همه‌ی ویدئوهایی که با 0. شروع میشه؛ اونوقت اصل آموزش دانشگاهی شروع میشه و هیچکس توی این آموزش سردرگم نیست که چی باید یاد بگیره یا پیش نیازی بوده که بلد نیست و ... ۱۰۰٪ پیشنهاد می‌کنم؛ من اولین بار ۷ سال پیش ویدئو‌های این دانشگاه رو دیدم و الان ۱۰۰ بار از اون موقع بهتر هست.
3 126
7
اما اینطوری هم نیست که از تغییرات دنیای Software Engineering عقب بمونم؛‌مثلا شب قبل هم گفتم از تسک کل هفته‌ام تسک ۵ روز رو دیروز زدم و ۲ روز آخر رو هم امروز میزنم. (بله من تسک‌هام رو توی ۷ روز پخش می‌کنم بجای ۵ روز کاری) اینطوری کل هفته بعدی برای خودم هست و جز review هایی که برام میاد کاری ندارم و می‌تونم به کارهای شخصی برسم. پرانتز باز کنم: چندسالی هست که اینکار رو می‌کنم. معمولا ۲ روز آخر هفته رو به کد زدن تسک هفته‌ام اختصاص میدم و اگر کارم زیاد باشه یا چیزی داشته باشه که باید بخونم و یادبگیرم ۳ روز آخر هفته رو بهش اختصاص میدم که از زمانی که LLM ها اومدند خیلی کم پیش میاد ۴ شنبه رو استراحت نکنم. چون با کمک LLM ها می‌تونم داکیومنت رو توی ۲-۳ ساعت بطور کامل بخونم. من از مدل‌های بزرگ اینطوری استفاده می‌کنم؛ اول یک پرامپت بهش میدم که کلیات داکیومنت رو بهم یاد بده؛ اینطوری بخش‌های مهم اون پکیج دستم میاد Trait, Struct, Error, ... درخواست بعدیم جزئیات بیشتر هست؛ مثلا:‌ فلان Trait چطوری کار می‌کنه ؟ چطوری پیاده‌سازی شده و ... برای کدهای Python هم همین هست؛ حالا اونجا Class, Type, Function, ... رو درنظر بگیرید. خلاصه‌اش:‌ هم یادگیری دارم؛ هم وقت خیلی کمتری ازم میگیره (معطل thinking, token generation نمی‌شم)؛ هم میدونم کد احمقانه که بعدا پروداکشن رو بخوابونه ندارم؛ هم یک peer-review قبل از peer-review همکارم دارم.
1
8
اول اینکه duck.ai خیلی خوبه توی مدل‌هاش Calude Haiku 4.5 رو هم داره که خب بهترین گزینه‌اس برای کار من؛‌ توی کمتر از ۵ ثانیه t
اول اینکه duck.ai خیلی خوبه توی مدل‌هاش Calude Haiku 4.5 رو هم داره که خب بهترین گزینه‌اس برای کار من؛‌ توی کمتر از ۵ ثانیه thinking رو تموم می‌کنه و سرعت تولید توکن خیلی بالاتری نسبت به باقی موارد داره. البته که من به قدرت مدل‌های دیگه هم نیاز ندارم؛‌ کد رو خودم میزنم برای ادیت یا جاهایی که شک دارم ازش استفاده می‌کنم فقط هیچ مدلی هنوز اونقدر خوب نیست که کدهای منو بزنه؛ مثلا این مورد رو همه‌ی مدل‌ها اشتباه کردند. توی Rust سعی کنید tracing رو به یک کد اضافه کنید که Async هست؛ اگر روی function کار کنید مدل‌های قویتر میفهمنند که باید از Instrument استفاده کنند که استفاده درستی هست ولی وقتی Middelware می‌خواید بنویسید همشون از scope.enter یا تکنیک‌های in_scope و ... استفاده می‌کنند که باعث میشه توالی لاگ‌های توی سیستم Async اشتباه بشه (چون scope روی یک ترد ایجاد میشه ولی تابع ممکنه روی اون ترد pause بشه و روی ترد دیگه‌ای اجرا بشه) و هیچکدوم از مدل‌ها این رو نمی‌فهمند. من شب قبل تست کردم. ادامه پست بعدی
1
9
80% کدهای پروداکشن من الان دسته duck.ai هست. 20% که خیلی سنگین میشه یا دیتای خیلی جدیدتر نیاز داره هم qwen-3.8
80% کدهای پروداکشن من الان دسته duck.ai هست. 20% که خیلی سنگین میشه یا دیتای خیلی جدیدتر نیاز داره هم qwen-3.8
1
10
در ادامه پروسه‌های باگ یابی من از شرکتهای هوش مصنوعی. الان متوجه شدم چرا خیلی از بچه‌ها میگن که فقط با Claude می‌تونند کد بزنند؛ من یک باگ جدید پیدا کردم. Qwen, Grok, ChatGpt, GLM5.2 رو تست کردم؛ این مدل‌های پارسر ضعیفتری دارند. اول اینکه بنظر میاد همشون کد رو هم مثل markdown باهاش برخورد می‌کنند و پارس می‌کنند چرا ؟ حجم زیادی کد بهشون دادم با پرامپت سختگیرانه (خیلی بی‌ادبی هست وگرنه میذاشتم) و همشون چون رو حالت سخت گیری هست ارورهای پارسر رو نادیده نمی‌گیرند. این نادیده گرفتن یک تکنیکی هست که ما هم توی پروداکشن استفاده می‌کنیم؛ اینطوری هست که اگر ببینید طرف راجب چیزی صحبت می‌کنه که به اندازه کافی علم داره ازش به مدل میگیم بعضی خطاها ممکنه اشتباه پارسر یا سرویس OCR باشه و نادیده‌اش بگیر. ولی اینجا مدل‌های بالا با پرامپتی که من دادم دیگه اینطوری نشد و کلی ایراد الکی گرفتند. بعنوان مثال : Bug 1: __main__.py entrypoint is broken You have: if name == "main": main() That is wrong. It must be: if __name__ == "__main__": main() بدتر از اون اینکه بعضی مدل‌ها حتی اینطوری می‌بیننش : if name من تمام مدل‌هایی که اسم بردم رو توی ۳ حالت استفاده کردم : ۱- با پرامپت سختگیرانه که بالاتر گفتم ۲- پرامپت ساده که فقط یک role بهش دادم (این مشکلات وجود نداشت)‌ ۳-پرامپت سختگیرانه +‌ استفاده از محیط چت و کپی پیست کد بعد از توضیح اینکه مطلب ارسالی کد پایتون هست. و بهترین جواب رو حالت سوم داد؛‌ اگر به اندازه کافی کانال رو دنبال کرده باشید می‌دونید که من اصلا به هیچ ابزار و agent ایی که دسترسی به سیستمم داشته باشه اعتماد ندارم و همیشه از محیط‌های چت مرورگر استفاده می‌کنم و کدهام رو اونجا بهشون میدم. با دیدن این نتابج الان میفهمم چرا برای خیلی از شما سوال میشه که من چطوری از Qwen, Duck.ai , ... استفاده می‌کنم و انقدر از خروجی‌هاش راضی هستم. بنظرم شما هم این رو تست کنید- من فقط روی ۴ مدلی که اسم بردم تست کردم.
2 564
11
زده من اینکار رو کردم بعدش دیگه چه کارهایی میشه کرد باهاش ؟ هیچی تلاش کردی چندتاش رو بهم وصل کنی ببینی چی میده یا اصلا چطوری باید کد بزنی برای اتصال چندتاش به هم دیگه ؟ سریعتر میشه؛ کندتر میشه ؟ حالا bottleneck کجاس ؟ اگر مدل بزرگتر باشه چی میشه ؟ اصلا چطوری میشه چندتاش رو بهم وصل کرد (کارت شبکه که نداره) مدل P4 که روی RiscV هست چطوری کار می‌کنه ؟ اگر همه این کارها رو کردی و جواب همش رو درست متوجه شدی یک سری به این سایت بزن Tenstorrent برای موقعیت های شغلی که دارند رزومه بده؛ من قبلا فرستادم ولی چون معماری RISC-V بود و من بلدش نبودم رزومه‌ام رد شد. پینوشت: چندتا از بچه‌ها این کار رو کردند و سوال پرسیدند.
2 369
12
لطفا ایشون رو برای همکاری استخدام کنید AI developer runs 28.9-million-parameter model on $10 ESP32-S3 microcontroller — uses Google's Per-Layer Embeddings technique, stores table on 16MB Flash memory اگر انقدر دیوونه هست که جنین کدی رو توی وقت‌های خالی خودش بزنه؛ ببین توی کار چه کدهایی میزنه. پینوشت: خروجیش ۱ توکن در ثانیه هست مهم کاری هست که کرده و کدی که زده
2 554
13
Claude Leak داستان چیه ؟ یک اتفاق تکراری دیگه. هرکسی روی Calude چت خودش رو لینک Share براش گرفته چت بصورت کامل عمومی شده. یک نفر هم اومده توی گوگل زده site:claude.ai/share و دیده بله گوگل تمام و کمال همرو ایندکس کرده. که خب یعنی خیلی شرکت‌های دیگه هم اینکار رو کردند و البته خیلی جاهای دیگه هم دیتاهای مهم رو خوندند. خیلی از بیزینس‌ها ابراز نگرانی کردند و گوگل نتایج رو حذف کرد و گفته میشه که کلاد هم باگ رو برطرف کرده. ولی همه می‌دونیم که ترین دیتای خوبی برای همه مدل‌ها آماده شد.
2 943
14
این رو معرفی کنم OKF (by google) وقتی مدل‌ها با کانتکست‌های بالای 128K و حالا بیش از 1M استاندارد شدند واقعا هزینه توسعه و نگهداری سیستم‌های RAG برام قابل درک نبود. توی یک سری از ابزارهای چت شما می‌تونید مشخص کنید چت با چه پیام‌هایی از قبل مشخص شده‌ای شروع بشه و ماهم از همین تکنیک استفاده میکردیم. مثلا برای نیروهای تازه وارد به شرکت؛ شماتیک دیتابیس رو توی چت اول میذاشتیم و نیرو همزمان با خوندن کدها اگر سوالی روی دیتابیس براش پیش میومد می‌تونست از مدل لوکال استفاده کنه و جلو بره. برای بچه‌های سنیور هم خیلی خوب بود؛ هم سوالات خیلی کم شده بود؛ هم کمکی بود برای یادآوری و هم اگر کوئری بود که یادشون میرفت می‌تونستند از مدل بپرسند و تقریبا مطمئن باشند که بهترین جواب رو احتمالا خواهند گرفت. حالا گوگل توی یک حرکت خیلی خفن اومده و یک استاندارد رو ارائه داده برای فرمت فایل‌ها و ... بجای اینکه یک چت هیستوری خیلی بزرگ به سیستم بدید (مثل کاری که ما می‌کردیم) اون‌ها رو توی فایل‌های markdown مختلف بشکونید ولی ابتدای هر فایل یک استاندارد رو رعایت کنید. تقریبا دو روزی هست که دارم روی یک دیتابیس پروداکشن استفاده‌اش می‌کنم و بنظرم این از RAG, chat history خیلی بهتره (حداقل توی استفاده من) مثلا:‌ توی سورس کد یک کوئری کند داشتیم و فکر میکردیم این دیگه ازین بهتر نمیشه؛ اما شد چون ما یک view ایی که ایجاد شده بود رو فراموش کردیم بودیم که همچین دیتایی رو داره و می‌تونه این کوئری رو هم اپتیمایز کنه و مدل این کوئری جدید رو بهمون داد. برای استفاده‌های این شکلی بنظرم خیلی تکنیک تمیز و خوبی هست. Github توجه کنید هیچ تکنولوژی یا ... جدیدی پشت این نیست دنبال ابزار نباشید یک استاندارد برای نوشتن فایل Markdown هست بیشتر که مدل‌ هوش مصنوعی شما راحت تر بفهمه چیکار کنه که بنظرم استاندارد تمیز و خوبی هم هست.
2 861
15
مدل‌های MoE خیلی جذابتر از مدل‌های Dense هستند بنظرم چون می‌تونی یک مدل خیلی بزرگتر رو روی یک GPU خیلی کوچکتر با سرعت بالا اجرا کنی مثل : https://telegram.me/per3onnel/263 یک سری افراد نشستند و همین کار رو برای GLM.5-2 با فشرده سازی و اپیتیمایز کردن بسیار انجام دادند بطوری که طبق ادعا خودشون مدل 774 میلیارد پارامتری رو روی سیستم با 25GB رم و بدون نیاز به GPU اجرا کردند (همه چیز روی C نوشته شده) بطور خیلی ساده کاری که می‌کنه اینه که یک backbone اصلی رو توی رم نگه میداره و باقی رو روی SSD - اگر یادتون باشه توی اون پست‌ها من توضیح دادم که MoE میشه بخش اصلی که نیاز به پردازش داره رو روی VRAM نگهداشت و باقی موارد رو روی RAM حالا این افراد یک قدم جلوتر رفتند و بخش زیادی رو روی SSD نگهداری می‌کنند؛ برعکس llamacpp که از memory mapping استفاده می‌کنه این کتابخونه صبر می‌کنه تا مدل تصمیم بگیره برای پرامپت دقیقا کدوم expert هارو نیاز داره و بعد همونارو روی SSD بخونه البته دنبال بهترین سرعت‌ها نباشید 0.1tok/sec چیزی هست که نویسنده گزارش داده روی لپ‌تاپ خودش اما این روش بنظرم خیلی جواب خواهد بود من ۳ سال قبل گفتم که روی یک پروژه قدیمی‌تر (الان حساب کنیم شاید ۷-۸ سال قبل) از Redis برای نگهداری embedding هام استفاده می‌کردم https://telegram.me/pytens/1087 حالا فرض کنید یک نفر همچین کاری رو بکنه : VRAM - RAM - SSD هرچند بنظرم تا استاندارد شدن این روش شاید راه طولانی رو در پیش نداشته باشیم حتی؛ سال‌هاست که CPU ها دارند اینکار رو می‌کنند L1, L2, L3, RAM, SSD برای بررسی دقیقتر به گیت‌هاب پروژه سر بزنید : Colibri Github
2 995
16
یک پستی از دوست و همکار قدیمی توی لینکدین دیدم راجب یک کتابی که درحال نوشته شدن و تکمیل هست مخصوص کسانی که به Deep Learning + Rust علاقمند هستند گفتم اینجا هم به اشتراک بذارم Linked In شخصا درحال خالی کردن وقت برای خوندنش هستم و پیشنهاد می‌کنم اگ
2 928
17
LLM قراره جای برنامه نویس‌هارو بگیره ؟ من که کدم رو + دستورالعمل ریفکتور دادم تا برام تمیز کنه و خروجی که توی تصویر هست نصف ب
LLM قراره جای برنامه نویس‌هارو بگیره ؟ من که کدم رو + دستورالعمل ریفکتور دادم تا برام تمیز کنه و خروجی که توی تصویر هست نصف باگ‌های مدل‌های LLM رو من درآوردم باید بهم هزینه پرداخت کنند واقعا پینوشت: تازه ۳۵ دقیقه هم طول کشید. خودم میزدم ۲۰ دقیقه‌ای تموم می‌شد.
2 000
18
Needle: We Distilled Gemini Tool Calling into a 26M Model این مدل برای تخصصی برای tool calling ساخته شده؛ من جایگزین مدل ۴ میلیارد پارامتری کردم و همچنان به درستی از ابزارهایی که داشتم استفاده می‌کنه. البته ابزارهای من ساده و قدیمی هست (خیلی وقت هست از این پروژه استفاده نکردم) اما بنظرم مدلی هست که ارزش تست کردن داشته باشه واقعا؛ اگر برای tool calling نیاز به مدل دارید یک تستی هم روی این انجام بدید اما بیشتر از tool call ازش توقع نداشته باشید.
2 723
19
95% of enterprise AI deployments fail to deliver value در یک حرکتی چندتا از این شرکت‌های AI فروش داخلی (کاسبان تحریم) روی موج‌های اخیر درحال تلاش برای خوروندن LLM به شرکت‌های دیگر هستند. شرکت‌هایی که همینطوری بخاطر تحریم؛ جنگ؛ قطعی اینترنت و تعطیلی به زور سرپا موندند. برای همین خواستم دوتا مورد رو یادآوری کنم: اولین مورد گزارش MIT روی میزان سودآوری AI (که ۹۵٪ میزان بازگشت 0 داشتند) ‌legal.io مورد دوم؛ تجربه شخصی بنده توی کار با تیمی از مهندس‌ها که مدتی قبل منتور اون‌ها بودم. ( استفاده درست از LLM ها برای مهندسی کامپیوتر ) با نهایت احترام به شرکت‌های AI داخلی که واقعا innovation دارند و در تلاش برای پیشرفت جامعه‌ی ایرانی هم هستند.
2 805
20
95% of enterprise AI deployments fail to deliver value در یک حرکتی چندتا از این شرکت‌های AI فروش داخلی (کاسبان تحریم) روی موج‌های اخیر درحال تلاش برای خوردوندن LLM به شرکت‌های دیگر هستند. شرکت‌هایی که همینطوری بخاطر تحریم؛ جنگ؛ قطعی اینترنت و تعطیلی به زور سرپا موندند. برای همین خواستم دوتا مورد رو یادآوری کنم: اولین مورد گزارش MIT روی میزان سودآوری AI (که ۹۵٪ میزان بازگشت 0 داشتند) ‌legal.io مورد دوم؛ تجربه شخصی بنده توی کار با تیمی از مهندس‌ها که مدتی قبل منتور اون‌ها بودم. ( استفاده درست از LLM ها برای مهندسی کامپیوتر ) با نهایت احترام به شرکت‌های AI داخلی که واقعا innovation دارند و در تلاش برای پیشرفت جامعه‌ی ایرانی هم هستند.
9