uk
Feedback
آخرین کد نویس

آخرین کد نویس

Відкрити в Telegram

دوران برنامه‌نویسی سنتی به پایان رسیده؛ یا با هوش مصنوعی هم‌مسیر می‌شی یا جا می‌مونی. اینجا یاد می‌گیریم چطور با اهرمِ AI، ده برابر سریع‌تر کد بزنیم و مهندسِ آینده باشیم. به جمع آخرین کدنویس‌ها خوش اومدی. گروه: https://t.me/lastcoderworldg

Показати більше
457
Підписники
+324 години
+107 днів
+5130 день

Триває завантаження даних...

Схожі канали
Немає даних
Виникли проблеми? Будь ласка, оновіть сторінку або зверніться до нашого support-менеджера.
Вхідні та вихідні згадування
---
---
---
---
---
---
Залучення підписників
серпень '26
серпень '26
+58
в 2 каналах
липень '26
+16
в 1 каналах
Get PRO
червень '26
+40
в 2 каналах
Get PRO
травень '26
+34
в 1 каналах
Get PRO
квітень '26
+1
в 0 каналах
Get PRO
березень '26
+2
в 0 каналах
Get PRO
лютий '26
+56
в 0 каналах
Get PRO
січень '26
+20
в 2 каналах
Get PRO
грудень '25
+111
в 2 каналах
Get PRO
листопад '250
в 2 каналах
Get PRO
жовтень '25
+72
в 3 каналах
Get PRO
вересень '25
+118
в 2 каналах
Дата
Залучення підписників
Згадування
Канали
28 серпня+5
27 серпня+3
26 серпня0
25 серпня+1
24 серпня+1
23 серпня0
22 серпня+1
21 серпня+5
20 серпня+1
19 серпня+3
18 серпня+5
17 серпня0
16 серпня+4
15 серпня+1
14 серпня+3
13 серпня+1
12 серпня+11
11 серпня+2
10 серпня+7
09 серпня0
08 серпня+1
07 серпня+1
06 серпня+1
05 серпня0
04 серпня0
03 серпня0
02 серпня0
01 серпня+1
Дописи каналу
سام آلتمن (مدیرعامل OpenAI): شما دیگر نیازی به نوشتن پرامپت ندارید. او در فقط ۳۸ دقیقه توضیح می‌دهد که چگونه از ChatGPT در سطحی استفاده کنیم که اکثر مردم حتی نمی‌توانند تصور کنند. این سخنرانی‌ای است که او برای دانشجویان استنفورد ایراد کرده است. یک دوست دیشب ضبط آن را برایم فرستاد. بعد از تماشای آن، فهمیدم که من فقط از حدود ۱۵٪ قابلیت‌های واقعی این ابزار استفاده می‌کردم. آن را کامل تماشا کنید و سپس راهنمای زیر را بخوانید که در مورد چگونگی ایجاد سیستمی است که خودش پرامپت تولید کند.

2
معرفی Gemini Omni 1.1 Flash این مدل مجموعه جدیدی از کنترل‌های خلاقانه و قابلیت‌های تولید ویدیو را برای توسعه‌دهندگان به ارمغا+1
معرفی Gemini Omni 1.1 Flash این مدل مجموعه جدیدی از کنترل‌های خلاقانه و قابلیت‌های تولید ویدیو را برای توسعه‌دهندگان به ارمغان می‌آورد - گسترش صحنه‌ها برای روایت‌گویی طولانی‌تر - مشخص کردن فریم‌های اول و آخر - پیش‌نویس ویدیوها به طور کارآمدتر در 360p - ارتقای کیفیت تا رزولوشن 4K - افزودن مراجع ویدیویی در ورودی چندوجهی خود اکنون از طریق API جمینی و در AI Studio در دسترس است.
140
3
چرا هوش مصنوعی در شمردن حروف Strawberry گیج می‌شود؟ اگر از پیشرفته‌ترین مدل‌های زبانی بپرسید در کلمه strawberry چند حرف r وجود دارد، احتمالاً اشتباه پاسخ می‌دهد! دلیلش این است که مدل‌ها حروف را مانند انسان نمی‌بینند؛ آن‌ها متن را به تکه‌هایی به نام توکن (Token) خرد می‌کنند. ۳ نکته کلیدی درباره دیدگاه توکنایزر: توکنایزرها قطعی هستند: کلمه ghost برای مدل ۱ توکن است، اما غلط املایی gohst به ۳ توکن مجزا خرد می‌شود g-oh-st. مدل نمی‌تواند مکث کند: مدل امکان توقف و بررسی تک‌تک کاراکترها را ندارد و با سطح زیرتوکن (Sub-token) چالش جدی دارد. تغییر حروف بزرگ/کوچک: عبارت strange new worlds شامل ۴ توکن است، اما نسخه بزرگ آن STRANGE NEW WORLDS به ۶ توکن کاملاً متفاوت تبدیل می‌شود! توصیه مهم به توسعه‌دهندگان: پردازش‌های سطح کاراکتر (مثل معکوس‌کردن رشته، شمارش حروف یا تطبیق Regex) را به مدل واگذار نکنید. این کارها را در کدنویسی سنتی Pre/Post-processing انجام دهید تا توان پردازشی مدل صرف مسأله اصلی شود. در قسمت بعدی بررسی می‌کنیم مدل‌ها چطور کلمات را توکن‌به‌توکن تولید می‌کنند و چرا راهی برای بازگشت و پاک‌کردن کلمات اشتباه قبلی خود ندارند.
455
4
Немає тексту...
156
5
چرا هوش مصنوعی با اعتمادبه‌نفس کامل دروغ می‌گوید؟ وقتی شما یک مقاله می‌نویسید و به آدرس یک لینک می‌رسید، دست از تایپ می‌کشید و آن را سرچ می‌کنید. اما مدل‌های زبانی نمی‌توانند مکث کنند یا سرچ کنند؛ آن‌ها صرفاً ادامه متن را حدس آماری می‌زنند! به همین دلیل اگر لینکی را ندانند، با اطمینان کامل یک آدرس اینترنتی ساختگی اما بسیار شبیه به واقعیت تولید می‌کنند. مدل‌ها فکر نمی‌کنند؛ تقلید می‌کنند مدل زبانی یک ماشین شبیه‌ساز (Mimic Machine) است. ورودی را می‌گیرد و بر اساس میلیاردها صفحه متنی که دیده، می‌پرسد: اگر سندی با این متن شروع شده باشد، محتمل‌ترین کلمات بعدی چیست؟ برای مدل، کلمات واقعی با کلمات ساختگی تفاوتی ندارند؛ هر دو فقط الگوهای آماری‌اند. تله‌ای به نام تعصب به واقعیت (Truth Bias) مدل فرض می‌کند هر چیزی در پرامپت نوشته‌اید حقیقت مطلق است. کمتر متنی در اینترنت با یک ادعای غلط شروع می‌شود و بلافاصله خودش را تکذیب می‌کند. پس اگر در پرامپت فرضی اشتباه بیاورید، مدل نه تنها شما را تصحیح نمی‌کند، بلکه روی همان ادعای غلط استدلال می‌سازد! پادزهر هالوسینیشن در مهندسی پرامپت دستورهایی مثل دروغ نگو یا مطمئن شو درسته بی‌اثرند. راهکار مهندسی، اعمال اصل اعتماد نکن و راستی‌آزمایی کن است: وادار کردن مدل به نوشتن زنجیره استدلال استخراج منابع و کلیدواژه‌ها جهت اعتبارسنجی خودکار با کدهای بیرونی در قسمت بعدی بررسی می‌کنیم توکنایزرها چطور کار می‌کنند و چرا حتی قوی‌ترین مدل‌ها در شمردن حروف یک کلمه ساده مثل Strawberry گیج می‌شوند.
241
6
Немає тексту...
200
7
۷۰ دلار اعتبار رایگان برای دسترسی مستقیم به API قدرتمندترین مدل‌های AI دنیا اگر برای توسعه پروژه‌ها، تست کدهای ایجنتی یا کارهای مهندسی نیاز به دسترسی مستقیم به مدل‌های پرچمدار مثل سری Opus دارید، این فرصت فوق‌العاده است: شرایط و جزئیات دریافت اعتبار: - اعتبار اولیه: ۷۰ دلار موجودی رایگان فقط با ورود از طریق اکانت گیت‌هاب (با قدمت حداقل ۱ سال). - پاداش رفرال: ۴۰ دلار اعتبار اضافه به ازای هر دعوت، و ۷۰ دلار برای شخص دعوت‌شده. - بونس روزانه: تا ۲۵ دلار پاداش ورود و لاگین روزانه. یک فرصت عالی برای توسعه‌دهندگانی که می‌خواهند بدون درگیر شدن با هزینه‌های سنگین دلاری، پایپلاین‌ها و ابزارهای خودشان را روی مدل‌های برتر تست و بنچمارک کنند. 🔗 api.justwoker.icu
154
8
NamiraNet نامیرا یک اکوسیستم برای فراهم کردن امکان اتصال آزاد و امن به اینترنت بین الملل برای همه ماست. زیرساخت نامیرا طوری ط
NamiraNet نامیرا یک اکوسیستم برای فراهم کردن امکان اتصال آزاد و امن به اینترنت بین الملل برای همه ماست. زیرساخت نامیرا طوری طراحی شده که در فاز فعلی توانایی scrape و بررسی میلیون ها کانفیگ رو با کمترین مصرف منابع و بالاترین دقت داره. هدف ما در نامیرا توسعه زیرساختی پایدار و پرسرعت برای عبور از تحریم ها و فیلترینگ است و قصد داریم با کیفیت ترین سرویس رو با جدید ترین متود ها ارائه بدیم. https://github.com/NamiraNet تلگرام برای دریافت کانفیگ ها : @NamiraConfigs
84
9
پرامپت انجینیرینگ واقعی چیست؟ ۴ سطح ساخت برنامه‌های مبتنی بر هوش مصنوعی اگر فکر کنیم پرامپت انجینیرینگ یعنی تغییر چند کلمه در یک جمله تا خروجی بهتری بگیریم، تصویر بسیار کوچکی از واقعیت را دیده‌ایم. در دنیای مهندسی نرم‌افزار، پرامپت انجینیرینگ یعنی طراحی یک سیستم نرم‌افزاری کامل که نقش لایه تبدیل (Transformation Layer) را بازی می‌کند؛ سیستمی که مسأله کاربر در دنیای واقعی را به یک سند متنی برای مدل تبدیل کرده و پاسخ مدل را دوباره به عملیات اجرایی و ارزش واقعی برای کاربر برمی‌گرداند. نویسندگان کتاب، ساخت برنامه‌های مبتنی بر مدل‌های زبانی (LLM) را به ۴ سطح از بلوغ و پیچیدگی تقسیم می‌کنند: سطح ۱: لایه بسیار نازک (Thin Application Layer) ساده‌ترین حالت تعامل؛ برنامه تقریباً بدون هیچ تغییری متن کاربر را به مدل پاس می‌دهد. اولین نسخه GitHub Copilot دقیقاً همین بود: فقط فایل جاری کدنویس را برای مدل می‌فرستاد تا ادامه آن را حدس بزند. سطح ۲: غنی‌سازی ورودی و مدیریت حافظه (Augmentation & Context) در این سطح، سیستم قبل از ارسال پرامپت، داده‌های کمکی و کلیدی را جمع‌آوری و تزریق می‌کند. به عنوان مثال، مهندسان Copilot متوجه شدند اگر کدهای تب‌های بازِ ادیتور برنامه‌نویس را هم به عنوان کانتکست وارد پرامپت کنند، دقت خروجی جهش بزرگی پیدا می‌کند. همچنین مدیریت تاریخچه مکالمه، خلاصه‌سازی و تزریق داده‌های مستندات برای جلوگیری از هالوسینیشن در این سطح انجام می‌شود. سطح ۳: اتصال به دنیای واقعی با ابزارها (Tool Calling & APIs) مدل‌های زبانی به خودی خود درون یک دنیای بسته متنی زندگی می‌کنند. در سطح ۳، برنامه به مدل امکان استفاده از APIها و توابع دنیای واقعی را می‌دهد؛ مثلاً مدل تشخیص می‌دهد برای تنظیم جلسه، باید از ابزار تقویم (Calendar API) استفاده کند و ایمیل دعوت ارسال نماید. سطح ۴: سیستم‌های عامل و خودمختار (Agency & Autonomy) بالاترین سطح پیچیدگی؛ جایی که شما به برنامه یک هدف کلی (Goal) می‌دهید و خود برنامه به صورت چندمرحله‌ای تصمیم می‌گیرد چه مراحلی را طی کند، چه اطلاعاتی جمع‌آوری کند و چطور خطاها را مدیریت کرده تا هدف نهایی محقق شود (نمونه‌های اولیه مثل AutoGPT). پایان فصل اول، در این فصل یاد گرفتیم مدل‌های زبانی از کجا آمدند و ساختار کلی ارتباط با آن‌ها چگونه است. از فصل بعدی وارد مباحث تخصصی‌تر زیرکاپوت مدل‌ها می‌شویم: مدل‌ها واقعاً کلمات را چطور می‌بینند؟ توکن‌ها چه نقشی در دقت کدنویسی دارند و پارامترهایی مثل Temperature و Logprob چطور رفتار مدل را تغییر می‌دهند؟ فصل اول، بخش چهارم کتاب Prompt Engineering for LLMs
855
10
گوگل بالاخره دوره آموزشی برنامه‌نویسی با هوش مصنوعی Vibe Coding خود را با نام AI for App Deployment عرضه کرد! این بخش جدید که به مدرک حرفه‌ای Google AI اضافه شده، دقیقاً دست روی نقطه ضعف اصلی خیلی از افراد گذاشته است: ساخت یک دمو ساده با AI آسان است، اما پروداکشن کردن، تست، دیباگ و قابل استفاده کردن آن برای بقیه جایی است که اکثر پروژه‌ها متوقف می‌شوند. سرفصل‌ها و مهارت‌های کلیدی این دوره: 1️⃣ برنامه‌ریزی قبل از پرامپت‌نویسی (Plan Before You Prompt) ◽️ ایده‌پردازی، ساختاردهی به نیازها و کشف خطاهای پنهان معماری برنامه قبل از شروع کدنویسی. 2️⃣ تست و دیباگ هدفمند (Test & Debug) ◽️ شکستن عمدی برنامه‌ها، ریشه‌یابی خطاها و دادن گاردریل به AI برای رفع اشکالات. 3️⃣ استقرار و عرضه نهایی (App Deployment) ◽️ تبدیل دموهای محلی به ابزارهای قابل استفاده و کاربردی برای تیم‌ها و کاربران واقعی. داستان لئو گارسیا (راننده سابق کامیون وال‌مارت که اکنون مدیر باربری است) نمونه عینی اهمیت این جریان است؛ او بدون داشتن دانش قبلی برنامه‌نویسی، ابتدا چالش‌های واقعی حوزه لوجستیک را شناخت و سپس ۴ برنامه کاربردی با AI طراحی کرد که یکی از آن‌ها برنامه‌ریزی شیفت‌ها و جلسات روزانه را به شدت بهینه کرد. در واقع، هوش مصنوعی برنامه‌نویسی را از یک دانش آکادمیک محض به یک ابزار حل مسئله کاربردی تبدیل کرده است. 🔗 لینک دوره 🔗 لینک دوره
892
11
Немає тексту...
274
12
استفاده از هوشمندترین مدل هوش مصنوعی لزوماً سیستم شما را هوشمندتر نمی‌کند؛ به‌خصوص در ایجنت‌ها. یک ایجنت هوشمند در لحظه‌ای به پردازش عمیق و منطقی Deep Reasoning نیاز دارد، اما در گام‌های بعدی، مشغول کارهای اجرایی مثل فراخوانی ابزارها Tool Calling، اعتبارسنجی خروجی‌ها و قالب‌بندی داده‌ها می‌شود. سپردن تمام این مراحل اجرایی به بزرگ‌ترین مدل‌های Frontier، تنها هزینه و تاخیر سیستم را بالا می‌برد. در همین راستا، انویدیا NVIDIA دو ابزار جدید و کلیدی معرفی کرده است: 1️⃣ مدل Nemotron 3.5 Lightning ◽️ یک مدل اپن‌سورس ۳۰ میلیاردی با معماری MoE فقط ۳ میلیارد پارامتر فعال. ◽️ تقطیرشده از مدل Nemotron 3 Ultra جهت اجرای لایه بالادستی و پرحجم ایجنت‌ها. ◽️ بهینه‌شده برای اجرا روی سیستم‌های کوچک‌تر و محلی با قابلیت سفارشی‌سازی کامل. 2️⃣ فریم‌ورک NeMo Switchyard ◽️ ابزار اپن‌سورس برای مسیریابی هوشمند بین مدل‌های مختلف در هر گام از فرآیند. ◽️ ارجاع گام‌های سنگین فکری به مدل‌های بزرگ و واگذاری گام‌های اجرایی به مدل‌های سریع‌تر و کوچک‌تر. ◽️ عدم نیاز به آموزش روتر برای شروع کار. یک سیستم ترکیبی که گام‌ها را درست مسیریابی کند، نه تنها از نظر هزینه و سرعت بهینه‌تر است، بلکه در سنجش دقت نهایی نیز می‌تواند از سیستم‌های تک‌مدلی عملکرد بهتری نشان دهد. دیگر نپرسید از چه مدلی استفاده کنم؟؛ بپرسید برای هر گام، کدام مدل مناسب‌تر است؟
281
13
Немає тексту...
223
14
اکثر کاربران هنوز در سطح ۱ استفاده از Claude متوقف شده‌اند! در ادامه ۶ سطح پیشرفته‌تر به‌کارگیری هوش مصنوعی Claude آورده شده است: مرور سطح ۱: انتهای هر پرامپت بنویسید: ابتدا از من سوال بپرس. کلود با شما مصاحبه می‌کند، پاسخ‌ها را می‌گیرد و خروجی ۱۰ برابر شخصی‌سازی‌شده‌تر می‌شود. 2️⃣ سطح ۲ → به جای تایپ، صحبت کنید ◽️ تایپ کردن ~۶۰ کلمه در دقیقه است، اما صحبت کردن ~۱۵۰ کلمه. ◽️ با ابزارهای صوتی (مثل Wispr) کانتکست‌های طولانی و عمیق را بسیار سریع‌تر به کلود منتقل کنید. 3️⃣ سطح ۳ → کار در محیط Cowork ◽️ وارد تب Cowork در اپلیکیشن کلود شوید. ◽️ فایل‌ها و داده‌های خام را وارد کرده و بخواهید خروجی‌های ساختاریافته مثل فایل اکسل یا داکیومنت بسازد. 4️⃣ سطح ۴ → اتصال اپلیکیشن‌ها (Connectors) ◽️ از بخش Connectors، ایمیل، تقویم و ابزارهای یادداشت‌برداری را متصل کنید. ◽️ پرامپت نمونه: با بررسی ایمیل‌ها، تقویم و یادداشت‌های جلسات، من را برای برنامه‌های فردا آماده کن. 5️⃣ سطح ۵ → یک‌بار آموزش، استفاده همیشگی (Skills) ◽️ با دستور skill-creator/ ساختار دلخواه خود (مثلاً قالب گزارش‌نویسی یا ساخت شیت) را آموزش دهید. ◽️ با ذخیره آن، از این پس تنها با یک شورت‌کات به آن مهارت دسترسی خواهید داشت. 6️⃣ سطح ۶ → تسلط بر مدل‌ها و میزان پردازش ◽️ انتخاب دقیق مدل (مثل Sonnet یا Opus) بر اساس پیچیدگی تسک. ◽️ تنظیم Effort روی حالت High برای کارهای سنگین و معمارانه. 7️⃣ سطح ۷ → کدنویسی بدون کد (Vibecode) ◽️ استفاده از بخش Code و دادن دسترسی مستقیم برای ساخت اپلیکیشن‌ها یا صفحات تعاملی وب تنها با توضیحات متنی.
421
15
Немає тексту...
246
16
چرا OpenAI در سال ۲۰۱۹ از انتشار عمومی GPT-2 ترسید؟ و چطور پرامپت انجینیرینگ متولد شد؟ بعد از معرفی معماری ترنسفورمر توسط گوگل در سال ۲۰۱۷، OpenAI دست به اقدام جالبی زد: آن‌ها بخش انکودر را کاملاً حذف کردند و فقط بخش دکودر (Decoder) را نگه داشتند. این ساده‌سازی باعث تولد معماری GPT (Generative Pre-trained Transformer) شد؛ معماری دست‌آفرینی که دنیای هوش مصنوعی را تکان داد. سیر تحول سری GPT و نقش آن در شکل‌گیری پرامپت انجینیرینگ به این شرح است: ۱. نسخه GPT-1 (سال ۲۰۱۸): مدلی با ۱۱۷ میلیون پارامتر. در آن زمان استاندارد کار این بود که مدل روی متون بدون برچسب اینترنت پیش‌آموزش (Pre-train) داده می‌شد و سپس برای انجام هر تسک خاص (مثل خلاصه‌سازی یا طبقه‌بندی) باید به صورت اختصاصی فاین‌تیون (Fine-tune) می‌شد. ۲. نسخه GPT-2 (سال ۲۰۱۹ - لحظه ترس پژوهشگران): حجم مدل ۱۰ برابر شد (۱.۵ میلیارد پارامتر) و روی ۴۰ گیگابایت متن وب آموزش دید. قدرت مدل در تولید متن‌های شبیه به انسان آن‌قدر بالا رفت که OpenAI در بیانیه‌ای رسمی اعلام کرد به دلیل نگرانی از استفاده‌های سوء (تولید اخبار جعلی، فیشینگ و اسپم) نسخه کامل آن را منتشر نمی‌کند! نکته عجیب GPT-2 این بود که بدون هیچ فاین‌تیون اختصاصی، در خیلی از تسک‌ها از مدل‌های تخصصی بازار بهتر عمل می‌کرد. ۳. نسخه GPT-3 (سال ۲۰۲۰ - تولد رسمیت پرامپت انجینیرینگ): یک جهش ۱۰۰ برابری دیگر! ۱۷۵ میلیارد پارامتر. مقاله این مدل یک تیتر کلیدی داشت: "Language Models Are Few-Shot Learners" (مدل‌های زبانی یادگیرنده‌های چندنمونه‌ای هستند). پژوهشگران فهمیدند اگر صرفاً چند مثال از الگوی کار درخواستی را داخل خودِ متن ورودی بگذارند، مدل الگوی ورودی را درک کرده و کار را انجام می‌دهد. دقیقاً در همین نقطه بود که مفهوم Prompt Engineering متولد شد؛ یعنی هدایت مدل فقط با طراحی هوشمندانه متن ورودی (Prompt) بدون دست زدن به وزن‌های مدل. ۴. انفجار ChatGPT و GPT-4 (از نوامبر ۲۰۲۲ تا امروز): با اضافه شدن معماری چت به GPT-3.5، ابزار ChatGPT منتشر شد و رکورد سریع‌ترین رشد کاربر در تاریخ را شکست. چند ماه بعد نسخه GPT-4 با ارتقایی نمایی (حدود ۱.۸ تریلیون پارامتر بر طبق گمانه‌زنی‌ها) وارد بازار شد.  در قسمت بعدی و پایانی این فصل، بررسی می‌کنیم که پرامپت انجینیرینگ واقعی در دنیای نرم‌افزار چیست و ۴ سطح پیچیدگی برنامه‌های مبتنی بر LLM شامل چه مواردی می‌شود. فصل اول، بخش سوم
721
17
Немає тексту...
227
18
📚 معرفی کتاب 📖 Secure Development Handbook ✍️ Charles Weir امن‌سازی نرم‌افزار دیگر یک انتخاب نیست، بلکه نیازی حیاتی در تمام
📚 معرفی کتاب 📖 Secure Development Handbook ✍️ Charles Weir امن‌سازی نرم‌افزار دیگر یک انتخاب نیست، بلکه نیازی حیاتی در تمام مراحل توسعه است. کتاب راهنمای توسعه امن نوشته چارلز ویر نشان می‌دهد چطور مباحث امنیتی را از روز اول وارد چرخه تولید نرم‌افزار کنید. این اثر رویکردی عملی برای کاهش آسیب‌پذیری‌ها بدون افت سرعت ارائه می‌دهد. خواندن این کتاب برای طراحان سیستم و توسعه‌دهندگان backend بسیار ارزشمند است. • اصول امن‌سازی کد • مدیریت ریسک نرم‌افزار • تست‌های امنیتی خودکار • مدل‌سازی تهدیدات سطح: 🟡 متوسط پیش‌بینی می‌شود برای یادگیری عمیق مطالب این کتاب، نیاز باشد حدود ۲۵ تا ۳۵ ساعت زمان اختصاص دهید. همین امروز خواندن این کتاب را شروع کنید. 📄 فایل PDF در پیام بعدی قرار گرفته است. @things_to_know_channel
77
19
چرا مدل‌های قدیمی هوش مصنوعی وسط متن دچار فراموشی می‌شدند؟ برای درک اینکه هوش مصنوعی چطور به نقطه کنونی رسید، باید به قبل از عصر GPT برگردیم. در سال ۲۰۱۴، قدرتمندترین مدل‌های پردازش زبان بر پایه معماری seq2seq (مخفف Sequence to Sequence) کار می‌کردند که توسط گوگل معرفی شده بود. این مدل‌ها از شبکه‌های عصبی بازگشتی RNN استفاده می‌کردند؛ یعنی متن را توکن به توکن می‌خواندند و وضعیت داخلی خود را به‌روزرسانی می‌کردند. کارکرد seq2seq از دو بخش اصلی تشکیل شده بود: ۱. انکودر (Encoder): ورودی را دریافت می‌کرد و خلاصهٔ آن را در متغیری به نام Thought Vector (بردار فکر) قرار می‌داد. ۲. دکودر (Decoder): با استفاده از این بردار، خروجی یا ترجمه را تولید می‌کرد. نقطه ضعف بزرگ: گلوگاه اطلاعاتی (Information Bottleneck) مشکل اصلی این بود که ظرفیت Thought Vector ثابت و محدود بود. وقتی طول متن ورودی زیاد می‌شد، انکودر مجبور بود تمام اطلاعات را در یک ظرف کوچک فشرده کند؛ در نتیجه اطلاعات بخش‌های ابتدایی متن فراموش می‌شدند. انقلاب اول: مکانیزم توجه (Attention Mechanism) در سال ۲۰۱۵، مقاله‌ای روش جدیدی برای حل این گلوگاه ارائه داد. به جای اینکه انکودر فقط یک بردار نهایی ارائه دهد، تمام حالت‌های ایجادشده برای هر کلمه حفظ شد و به دکودر اجازه داده شد در میان تمام آن‌ها «جستجوی نرم» (Soft Search) انجام دهد. این تکنیک به عنوان مکانیزم توجه (Attention) شناخته شد و کیفیت ترجمه و پردازش متن را جهش داد. انقلاب دوم: ظهور معماری ترنسفورمر (Transformer) نقطه عطف اصلی در سال ۲۰۱۷ با مقاله تاریخی گوگل یعنی Attention Is All You Need رقم خورد. در این مقاله، معماری ترنسفورمر معرفی شد. ترنسفورمرها تمام مدارهای بازگشتی و پیچیده گذشته را دور ریختند و اتکای کامل خود را روی مکانیزم توجه گذاشتند. این معماری بسیار انعطاف‌پذیرتر بود و داده‌ها را بسیار بهتر مدلسازی می‌کرد. اما ترنسفورمرها یک محدودیت جدید هم داشتند: برخلاف مدل‌های قدیمی که می‌توانستند ورودی با طول نامحدود بگیرند، ترنسفورمر فقط می‌توانست ورودی و خروجی با طول مشخص و محدود (Fixed Sequence) را پردازش کند—محدودیتی که پایه و اساس پنجره بافت (Context Window) در مدل‌های امروزی است.  در پست بعدی بررسی می‌کنیم چطور OpenAI با دستکاری معماری ترنسفورمر، سری GPT را خلق کرد و چرا نسخه GPT-2 باعث ترس خود پژوهشگران شد.
571
20
Немає тексту...
240