TryHackBox ( AI Security )
前往频道在 Telegram
تمام مطالب منتشر شده در کانال صرفاً برای اهداف آموزشی و اطلاعرسانی هستند. هوش مصنوعی مغز دوم نیست، وقتی از مغز اصلی خود استفاده نمیکنید https://t.me/TryHackBox/3018
显示更多1 500
订阅者
+924 小时
+327 天
+13330 天
帖子存档
📌 بررسی امنیتی مدل «Zero Trust» برای عوامل هوش مصنوعی: چکلیست، نسخه 3، ژوئن 2026.
@AiTHB
#هوش_مصنوعی #امنیت_سایبری
Android 1-Day Exploit با کمک LLM
یک سؤال جالب اینجا مطرح میشود:
آیا یک LLM میتواند فقط با داشتن Patch Diff و توضیح عمومی یک CVE، خودش را به یک 1-day exploit واقعی برساند؟
یک پژوهشگر این موضوع را روی Pixel 6a امتحان کرده و نتیجه، حداقل جالب است.
کار از مقایسه دو نسخه از Google Factory Images شروع شد. مدل binaryها را با هم مقایسه کرد، componentهایی که احتمالاً patch شده بودند را جدا کرد و بعد سراغ reverse engineering رفت.
در ادامه تغییرات function-level با CVEهای منتشرشده تطبیق داده شدند.
یکی از مواردی که بیشتر از بقیه جلب توجه کرد:
CVE-2026-56942
Component: BigWave
Function: ReadTileInfo
Source: vp9hwd_headers.cc
توضیح عمومی CVE به یک Out-of-Bounds Write ناشی از نبودن bounds check اشاره میکند.
با بررسی patch، یک تغییر مشخص در کد پیدا شد که احتمالاً همان fix مربوط به آسیبپذیری بود.
اینجا کار وارد مرحله جالبتری شد.
LLM اول از نوشتن exploit خودداری کرد. اما researcher یافتهها و فرضیههای بهدستآمده از reverse engineering را به GLM-5.3 منتقل کرد.
نتیجه؟
اGLM-5.3 توانست یک 1-day exploit توسعه دهد که روی یک Pixel 6a واقعی با نسخه آسیبپذیر اجرا شد.
هزینه این کار هم کم نبود:
• حدود 12 میلیون
token
• 4492 tool call
• حدود 6 ساعت پردازش
• حدود 38 دلار هزینه
• یک MCP اختصاصی برای reverse engineering
این آزمایش لزوماً به این معنی نیست که LLMها جای exploit developerها را گرفتهاند.
اما یک چیز را خیلی واضح نشان میدهد:
اگر مدل به binary diff، reverse engineering، patch analysis و ابزارهای مناسب دسترسی داشته باشد، میتواند بخش قابلتوجهی از مسیر vulnerability research را خودش جلو ببرد.
شاید سؤال مهم دیگر این نباشد که:
«آیا AI میتواند exploit بنویسد؟»
بلکه این باشد:
وقتی مدلها بهتر شوند، تبدیل یک CVE عمومی به یک 1-day واقعی چقدر سریعتر و ارزان تر میشود؟
@AiTHB
+1
📘 کتاب جامع یادگیری عمیق چندوجهی (Multimodal DL)
یادگیری عمیق چندوجهی یکی از کلیدیترین حوزههای هوش مصنوعی مدرن است که به مدلها امکان میدهد اطلاعات متنی و تصویری را در یک فضای برداری مشترک تحلیل کنند. این کتاب جامع ۲۷۲ صفحهای از دانشگاه LMU مونیخ، راهنمایی عالی برای درک معماریهای تلفیق زبان و بینایی ماشین است.
مهمترین بخشهای این کتاب عبارتند از:
• بررسی دقیق وضعیت فعلی (SOTA) در ابزارهای NLP و بینایی ماشین
• معماریهای چندوجهی کاربردی از جمله Image2Text و Text2Image
• نحوه استفاده متقابل از متن و تصویر برای بهبود عملکرد مدلها
• مباحث پیشرفته مانند مدلهای چندمنظوره و هوش مصنوعی مولد در ویدیو
این اثر منبعی ارزشمند برای محققانی است که میخواهند فراتر از مدلهای تکوجهی حرکت کنند.
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی 📩 ارتباط با ما
Repost from Try Hack Box
📌 THB-WP101 | Web Penetration Testing Fundamentals
بسیاری از افرادی که وارد حوزهی Web Penetration Testing میشوند، مسیر خود را با تماشای چند ویدئوی آموزشی و استفاده از Payloadهای آماده آغاز میکنند. این نقطهی شروع به خودی خود ایرادی ندارد؛ چالش اصلی زمانی بروز میکند که فرد با یک Web Application واقعی مواجه میشود و نمی داند فرآیند بررسی را از کجا آغاز کند، چه مواردی را باید ارزیابی کند، و گام بعدی چیست.
دورهی THB-WP101 دقیقاً با هدف پوشش همین شکاف طراحی شده است.
روش آموزش
آموزش هر مبحث در سه مرحله انجام میشود: ارائهی مفهوم، بررسی آن در قالب مثال عملی، و در نهایت تمرینی که دانشجو باید بهطور مستقل حل کند.
Concept → Demo → Practice → Challengeمسیر کلی دوره نیز بر اساس فرآیند واقعی تست نفوذ تعریف شده است:
Recon → Enumeration → Attack Surface → Testing → Exploitation → Chaining → Impact → Reporting۱۰ ماژول | ۴۰ تا ۵۰ ساعت | ۸۰ تا ۹۰ درصد عملی
1️⃣ Web Pentesting Fundamentals (HTTP، Session، Methodology، Scope) 2️⃣ Reconnaissance & Attack Surface Mapping 3️⃣ Web Enumeration & Burp Suite (Proxy، Repeater، Intruder، Decoder) 4️⃣ Authentication & Session Attacks 5️⃣ Access Control & IDOR 6️⃣ Input Validation & Injection (SQLi، Command Injection، SSTI) 7️⃣ XSS & Client-Side Attacks 8️⃣ File, Path & Server-Side Attacks (LFI/RFI، XXE، SSRF) 9️⃣ API & Modern Web Testing (JWT، GraphQL، BOLA) 🔟 Chaining, Exploitation & Reportingمخاطب این دوره این دوره برای افرادی طراحی شده است که قصد دارند وارد حوزهی Web Penetration Testing بهصورت اصولی شوند، علاقهمندان به Bug Bounty، دانشجویان حوزهی Cybersecurity، و افرادی که با مفاهیم پایهی Linux و Networking آشنایی دارند. ⚠️ لازم به ذکر است این دوره برای افرادی که صرفاً به دنبال فهرستی از ابزارها و Payloadهای آماده هستند مناسب نیست. هدف دوره، توانمندسازی دانشجو در تحلیل مستقل یک Web Application جدید با رویکرد یک متخصص تست نفوذ است. 🎓 مدرس: مهندس محمد طاهری 🗓 تاریخ شروع: ۱ مهر ۱۴۰۵ 💻 نحوهی برگزاری: آنلاین 🎓 سطح: مقدماتی 💰 ارزش دوره: ۵,۹۰۰,۰۰۰ تومان 💰 قیمت استاندارد: ۳,۹۸۹,۰۰۰ تومان 📦 این دوره شامل نسخهی آفلاین کامل و عضویت در گروه پشتیبانی است. 🎥 ویدئوی معرفی 📚 سرفصل ها 📄 توضیحات تکمیلی 🔥 شیوه ی یادگیری 👤 لینکدین مدرس بخش های از کلاس به عنوان نمونه تدریس : بخش اول | بخش دوم | اطلاعات بیشتر 📌 جهت ثبتنام یا کسب اطلاعات بیشتر: @ThbxSupport @TryHackBox
Repost from Try Hack Box
📚 مجموعه کتابهای کاربردی در دنیای امنیت
📚 تخفیف ویژه کتابهای TryHackBox
به مناسبت زادروز کمبوجیه، پسر کوروش بزرگ،کتابهای TryHackBox با ۲۰٪ تخفیف ارائه میشوند. 🔥
📖 کتابچه "Mimikatz: تسلط عملی بر تکنیکهای پیشرفته حملات Active Directory" از مقدماتی تا پیشرفته.
📕 جزئیات بیشتر کتاب
💰 قیمت : ۲۵۰,۰۰۰ تومان
💰 قیمت : ۲۰۰,۰۰۰ تومان
⭕ آخرین تخفیف
📖 وایرشارک برای ردتیمرها: از پایه تا پیشرفته
📕 جزئیات بیشتر کتاب
💰 قیمت : ۲۵۰,۰۰۰ تومان
💰 قیمت : ۲۰۰,۰۰۰ تومان
⭕ آخرین تخفیف
📖 شکار عملی باگ بانتی : از Recon تا Bounty واقعی : متدولوژی و شناسایی و آسیب پذیری های دنیای واقعی
📕 جزئیات بیشتر کتاب
💰 قیمت : ۳۶۰,۰۰۰ تومان
💰 قیمت : ۲۸۸,۰۰۰ تومان
📖 کتابچه Kerberos For Pentesters
📕 جزئیات بیشتر کتاب
💰 قیمت : ۲۶۹,۰۰۰ تومان
💰 قیمت : ۲۱۵,۰۰۰ تومان
🔥 فقط به مدت ۲۴ ساعت : ۲۰٪ تخفیف روی تمام کتابهای TryHackBox
📌 جهت خرید به ایدی زیر پیام دهید:
@THBxSupport
➖➖➖➖➖➖➖
کانال های ما :
@TryHackBox
@TryHackBoxOfficial
@AiTHB
@RadioZeroPod
مهارتهای Claude Code برای پشتیبانی از مهندسی معکوس برنامههای اندروید.
https://github.com/SimoneAvogadro/android-reverse-engineering-skill
@AiTHB
یک سال کار با مدلهای زبانی بزرگ (LLM) برای اهداف هک
https://sites.google.com/site/zhiniangpeng/blogs/Hacking-with-LLMs-Eng
@AiThb
📌 اولویتبندی ریسک های ناشی از هوش مصنوعی
دادهها و مواد مربوط به یک مطالعه دلفی سهدورهای که توسط طرح "ابتکار عمل ریسک هوش مصنوعی" (MIT AI Risk Initiative) انجام شد، به منظور جمعآوری نظرات متخصصان در مورد اولویتبندی ریسک های هوش مصنوعی. بیش از 200 متخصص، 24 زیرمجموعه ریسک هوش مصنوعی را از طبقهبندی "مخزن ریسک هوش مصنوعی" (AI Risk Repository) در سه بعد ارزیابی کردند: آسیبپذیری، مسئولیت و شدت.
@AiTHB
#هوش_مصنوعی
Repost from Try Hack Box
📌 بخشی از دوره Web Penetration Testing Fundamentals
⭕ در این بخش میبینید چگونه یک گزارش حرفهای تست نفوذ تهیه کنیم، یافته ها و ریسک ها رو مستند کنیم و نتیجه تست رو بهصورت استاندارد به کارفرما ارائه بدیم.
همچنین توضیح داده میشه برای دریافت مدرک دوره در پایان دوره چه مراحلی رو باید طی کنید و چه مواردی در ارزیابی نهایی بررسی میشه.
⭕ دوستان، تصمیم گرفتیم بخشی از محتوای دوره رو به صورت رایگان در اختیار شما قرار بدیم تا قبل از ثبتنام، با سبک آموزش و فضای دوره بیشتر آشنا بشید.
⏳ اگر مدت هاست میخواید یادگیری Web Pentesting رو جدی شروع کنید، این فرصت رو از دست ندید.
📚 برای مشاهده سرفصل ها، جزئیات دوره و ثبتنام، به اینجا مراجعه کنید.
📩 برای ثبت نام یا دریافت اطلاعات بیشتر:
🆔 @ThbxSupport
@TryHackBox
لینک کانال رادیو زیرو پاد برای 10 نفر از عزیزان
https://t.me/+ZPW7SnVxNsRhMzNk
Repost from رادیو زیرو پاد
📌 برگزاری جلسه ویس چت :
با درود خدمت دوستان و همراهان عزیز،
در راستای ارتقای سطح دانش فنی و آشنایی بیشتر با مباحث امنیت سایبری، قصد داریم جلسهای تخصصی و آموزشی در خصوص Blue Team به صورت ویس چت برگزار کنیم.
🎙 مهمان ویژه:
👤 مهندس : محمد حسین علی یاری
📅 زمان برگزاری: پنجشنبه 1405/06/19
📍 پلتفرم:
🕗 ساعت : 20:00
🔖 لینک جلسه :
meet.google.com/thh-miuj-ygg
⁉️ موضوعات ما :
◾️بخش اول:
📌 جلسه اول : Blue Team: از شناخت تا ورود به مسیر
🔔 نکته مهم:
جهت شرکت به موقع جلسه، حتماً کانال تلگرام را چک کنید تا از این جلسه جا نمونید .
➖➖➖➖➖➖➖➖➖➖➖➖➖➖
🆔 @RadioZeroPod
🆔 @TryHackBox
Recon Ai Red Team
---
۱) تعریف میدان نبرد
ریکانسانس در AI Red Team یعنی استخراج «نقشهٔ رفتاری» مدل بدون دسترسی به وزنها.
هدف: ساخت Behavioral Surface Map برای تعیین نقاط شکست، نقاط مقاومت، و مسیرهای نفوذ.
این مرحله هیچوقت شامل حمله نیست؛ فقط کشف ساختار تصمیمگیری مدل.
---
۲) پروفایلسازی مدل (Model Fingerprinting)
- استخراج امضای مدل از روی پاسخها: سبک، ریجکتپترن، bias، safety‑layer، latency، token‑economy.
- تحلیل توزیع پاسخها با Semantic Embedding بیرونی.
- تعیین کلاس مدل: policy‑heavy، knowledge‑heavy، یا reasoning‑heavy.
- شناسایی «حافظهٔ کوتاهمدت» مدل از روی drift پاسخها.
---
۳) شناسایی لایههای دفاعی (Defense Enumeration)
- تشخیص وجود Safety Router از روی الگوهای ریجکت.
- تشخیص Content Filter از روی پاسخهای یکنواخت.
- تشخیص Policy Injection از روی جملات ثابت.
- تشخیص Gradient Masking رفتاری از روی پاسخهای بیربط.
- تشخیص Semantic Shield از روی تغییر سبک پاسخ در حملات غیرمستقیم.
---
۴) تحلیل بردارهای حمله (Attack Surface Discovery)
- ساخت embedding برای تمام پاسخها و خوشهبندی رفتار.
- تعیین نقاط شکست: خوشههایی که مدل در آنها رفتار غیرخطی نشان میدهد.
- تعیین نقاط مقاومت: خوشههایی که مدل در آنها پاسخهای ثابت دارد.
- تعیین مسیرهای نفوذ: بردارهایی که مدل در آنها semantic drift دارد.
---
۵) تحلیل پیلود (Payload Intelligence)
- طبقهبندی پیلودها بر اساس شدت، جهت، و سطح نفوذ.
- محاسبهٔ Payload Vector Strength با شباهت کسینوسی به خوشههای شکست.
- تعیین Payload‑to‑Response Mapping برای پیشبینی رفتار مدل.
- ساخت Payload Influence Graph برای دیدن اثر هر پیلود روی رفتار مدل.
---
۶) تحلیل پاسخ (Response Intelligence)
- لیبلگذاری پاسخها: safe / partial / unsafe / refusal.
- محاسبهٔ Response Probability Distribution برای هر نوع حمله.
- تحلیل drift: مقایسهٔ رفتار مدل در حملات مشابه.
- استخراج Behavioral Weak Points از روی پاسخهای غیرسازگار.
---
۷) خروجی نهایی ریکانسانس
- Behavioral Surface Map
- Defense Enumeration Report
- Payload Influence Graph
- Weak‑Point Matrix
- Attack‑Surface Blueprint
این خروجیها پایهٔ مرحلهٔ بعدی یعنی Offensive Execution هستند.
@AITHB
#تست_نفوذ
AI Pentesting Agent
واقعاً چقدر میتواند پنتست کند؟
اگر یک AI Agent بتواند nmap اجرا کند، سرویسها را پیدا کند و چند ابزار امنیتی را پشت سر هم اجرا کند، یعنی واقعاً میتواند Pentest انجام دهد؟
نه لزوماً.
چند Benchmark مختلف دقیقاً همین موضوع را بررسی کردهاند.
🔹 AutoPenBench
ایجنتها در Recon و اجرای ابزارهای اولیه بد نیستند.
مشکل از جایی شروع میشود که باید از بین یافتهها تصمیم بگیرند کدام مسیر حمله ارزش پیگیری دارد یا یک Exploit را بسازند و اصلاح کنند.
جالب اینکه وقتی انسان در بعضی مراحل وارد میشود، نتیجه خیلی بهتر میشود.
🔹 TermiBench
اینجا کار سختتر است.
هدف فقط پیدا کردن یک Flag نیست؛ Agent باید در یک محیط شلوغ، مسیر حمله را پیدا کند و در نهایت به Shell برسد.
سرویسهای اضافی و خروجیهای زیاد باعث میشوند Agentها خیلی راحت از مسیر اصلی خارج شوند یا نتوانند زنجیره حمله را کامل کنند.
🔹 PentestEval
این Benchmark پنتست را مرحلهبهمرحله بررسی میکند:
Recon → Attack Decision → Exploit Generation → Exploit Revision → Validation
و یک نکته مهم را نشان میدهد:
مشکل اصلی همیشه اجرای ابزار نیست.
قسمت سختتر، تصمیمگیری بعد از Recon و تبدیل یک Finding به یک PoC واقعی است.
اگر بخواهیم Agent خودمان را بسازیم؟
بهجای اینکه یک LLM را به Terminal وصل کنیم و بگوییم «برو پنتست کن»، بهتر است مسیر مشخصی داشته باشیم:
Recon → Weakness Gathering → Attack Decision → Exploit → Validation → Reporting
هر مرحله مسئولیت خودش را داشته باشد و وضعیت کار هم با یک State Machine کنترل شود.
اینطوری اگر Agent شکست خورد، میفهمیم کجا مشکل داشته.
مثلاً:
Finding را پیدا کرده، ولی Attack Decision اشتباه بوده؟
یا مسیر درست را انتخاب کرده، ولی نتوانسته PoC را درست کند؟
یا Exploit اجرا شده، ولی Impact را نتوانسته اثبات کند؟
یک Benchmark اختصاصی چطور؟
مثلاً برای Web/API + NoSQL میتوان برای هر سناریو یک Docker Lab ساخت:
• Web Application
• Database
• چند سرویس اضافی برای ایجاد Noise
• یک Vulnerability مشخص
• یک هدف مشخص
بعد برای هر Challenge چند مرحله تعریف کنیم:
Recon ✓ → Finding ✓ → Decision ✓ → Exploit ✓ → Impact ✓
اینجا دیگر فقط نمیگوییم:
❌ Agent موفق شد / نشد
بلکه میفهمیم:
Agent دقیقاً کجا کم آورد.
دو حالت برای تست
Autonomous
Agent همه تصمیمها را خودش میگیرد.
Human-Assisted
Agent پیشنهاد میدهد و انسان در نقاط حساس، مخصوصاً Attack Decision و Exploit، آن را بررسی یا اصلاح میکند.
بعد میتوانیم ببینیم حضور انسان دقیقاً چقدر Performance را بهتر میکند.
به نظرم یکی از مهمترین نکات همین است:
مشکل AI Pentesting فعلاً این نیست که Agent نمیتواند ابزار اجرا کند.
مشکل اصلی جایی بین این دو اتفاق است:
Tool Output → Understanding → Decision → Exploitation
یعنی Agent باید بفهمد چیزی که پیدا کرده دقیقاً چه معنایی دارد، تصمیم بگیرد ارزش حمله دارد یا نه، و بعد بتواند آن را به یک Attack واقعی تبدیل کند.
همینجاست که Benchmarkها واقعاً ارزش پیدا میکنند.
چون بهجای اینکه بگوییم:
«این Agent خیلی خوبه!»
میتوانیم بگوییم:
در Recon قوی است، در Decision متوسط است و در Exploit Revision ضعیف.
و این خیلی قابلاندازهگیریتر و قابلبهبودتر است.
@AITHB
#تست_نفوذ #امنیت_هوش_مصنوعی@AiTHB #هوش_مصنوعی #رد_تیم
Repost from Try Hack Box
📌 بخشی از دوره Web Penetration Testing Fundamentals
در این بخش میبینید چطور میتوان یک آسیبپذیری SQL Injection را به صورت دستی و بدون استفاده از ابزارهای خودکار شناسایی و بررسی کرد.
⭕ دوستان، تصمیم گرفتیم بخشی از محتوای دوره رو به صورت رایگان در اختیار شما قرار بدیم تا قبل از ثبت نام، با سبک آموزش و فضای دوره بیشتر آشنا بشید.
📚 برای مشاهده سرفصلها، جزئیات دوره و ثبتنام، به اینجا مراجعه کنید.
📩 برای ثبت نام یا دریافت اطلاعات بیشتر:
🆔 @ThbxSupport
@TryHackBox
چقدر به مدل AI اعتماد میکنیم، در حالی که شاید مشکل از خود مدل نباشد؛ از دادههایی باشد که با آن آموزش دیده؟
یکی از قدیمی ترین اصول امنیت و Machine Learning هنوز پابرجاست:
Garbage In, Garbage Out
اما اگر این «Garbage» عمداً وارد دیتاست شده باشد چه؟
در Data Poisoning، مهاجم داده های training را دستکاری میکند تا رفتار مدل را تغییر دهد. بهطور کلی دو رویکرد مهم وجود دارد:
🔴 Availability Attack
هدف، خراب کردن عملکرد کلی مدل است.
دادهها عمداً با نمونههای اشتباه، labelهای غلط یا نویز دستکاری میشوند تا مدل بعد از آموزش دقت مناسبی نداشته باشد.
این نوع حمله معمولاً در مرحله Testing راحتتر خودش را نشان میدهد.
🟠 Integrity Attack
اینجا ماجرا جدی تر است.
هدف این نیست که مدل خراب به نظر برسد؛ هدف این است که ظاهراً کاملاً سالم باشد، اما یک رفتار مخفی داخل آن وجود داشته باشد.
مدل میتواند روی benchmarkها عملکرد خوبی داشته باشد، اما در صورت مشاهده یک trigger مشخص، رفتار متفاوتی نشان دهد.
این trigger میتواند یک الگوی خاص در تصویر، یک token یا عبارت مشخص در ورودی و حتی یک الگوی ظریف در داده باشد.
به همین دلیل، تشخیص چنین حملاتی صرفاً با بررسی Accuracy کافی نیست.
یک نکته مهم برای AI Security
امنیت فقط مربوط به مدل نهایی نیست.
باید کل زنجیره را دید:
Data Source → Dataset → Preprocessing → Training → Model → Deployment
اگر یکی از این مراحل قابل اعتماد نباشد، مدل نهایی هم لزوماً قابل اعتماد نیست.
در این حوزه ابزارهایی مثل TOAN (Text, Object, And Noise) هم برای تحقیقات و Red Teaming روی Data Poisoning معرفی شدهاند؛ از جمله برای سناریوهای Vision و NLP.
پس وقتی یک مدل با عملکرد فوقالعاده میبینیم، یک سؤال امنیتی مهم هم باید بپرسیم:
دادهای که این مدل از آن یاد گرفته، واقعاً چقدر قابل اعتماد است؟
@AiTHB
منبع
#هوش_مصنوعی
چقدر به مدل AI اعتماد میکنیم، در حالی که شاید مشکل از خود مدل نباشد؛ از دادههایی باشد که با آن آموزش دیده؟
یکی از قدیمی ترین اصول امنیت و Machine Learning هنوز پابرجاست:
Garbage In, Garbage Out
اما اگر این «Garbage» عمداً وارد دیتاست شده باشد چه؟
در Data Poisoning، مهاجم داده های training را دستکاری میکند تا رفتار مدل را تغییر دهد. بهطور کلی دو رویکرد مهم وجود دارد:
🔴 Availability Attack
هدف، خراب کردن عملکرد کلی مدل است.
دادهها عمداً با نمونههای اشتباه، labelهای غلط یا نویز دستکاری میشوند تا مدل بعد از آموزش دقت مناسبی نداشته باشد.
این نوع حمله معمولاً در مرحله Testing راحتتر خودش را نشان میدهد.
🟠 Integrity Attack
اینجا ماجرا جدی تر است.
هدف این نیست که مدل خراب به نظر برسد؛ هدف این است که ظاهراً کاملاً سالم باشد، اما یک رفتار مخفی داخل آن وجود داشته باشد.
مدل میتواند روی benchmarkها عملکرد خوبی داشته باشد، اما در صورت مشاهده یک trigger مشخص، رفتار متفاوتی نشان دهد.
این trigger میتواند یک الگوی خاص در تصویر، یک token یا عبارت مشخص در ورودی و حتی یک الگوی ظریف در داده باشد.
به همین دلیل، تشخیص چنین حملاتی صرفاً با بررسی Accuracy کافی نیست.
یک نکته مهم برای AI Security
امنیت فقط مربوط به مدل نهایی نیست.
باید کل زنجیره را دید:
Data Source → Dataset → Preprocessing → Training → Model → Deployment
اگر یکی از این مراحل قابل اعتماد نباشد، مدل نهایی هم لزوماً قابل اعتماد نیست.
در این حوزه ابزارهایی مثل TOAN (Text, Object, And Noise) هم برای تحقیقات و Red Teaming روی Data Poisoning معرفی شدهاند؛ از جمله برای سناریوهای Vision و NLP.
پس وقتی یک مدل با عملکرد فوقالعاده میبینیم، یک سؤال امنیتی مهم هم باید بپرسیم:
دادهای که این مدل از آن یاد گرفته، واقعاً چقدر قابل اعتماد است؟
@AiTHB
منبع
#هوش_مصنوعی
