en
Feedback
Tensorflow(@CVision)

Tensorflow(@CVision)

Open in Telegram

اخبار حوزه یادگیری عمیق و هوش مصنوعی مقالات و یافته های جدید یادگیری عمیق بینایی ماشین و پردازش تصویر TensorFlow, Keras, Deep Learning, Computer Vision سایت: http://class.vision 👨‍💻👩‍💻پشتیبان دوره ها: @classvision_support لینک گروه: @tf2keras

Show more

📈 Analytical overview of Telegram channel Tensorflow(@CVision)

Channel Tensorflow(@CVision) (@cvision) in the Farsi language segment is an active participant. Currently, the community unites 15 109 subscribers, ranking 8 263 in the Technologies & Applications category and 21 715 in the Iran region.

📊 Audience metrics and dynamics

Since its creation on невідомо, the project has demonstrated rapid growth, gathering an audience of 15 109 subscribers.

According to the latest data from 06 October, 2026, the channel demonstrates stable activity. Although there has been a change in the number of participants by 0 over the last 30 days and by -1 over the last 24 hours, overall reach remains high.

  • Verification status: Not verified
  • Engagement rate (ER): The average audience engagement rate is 12.93%. Within the first 24 hours after publication, content typically collects 7.87% reactions from the total number of subscribers.
  • Post reach: On average, each post receives 1 954 views. Within the first day, a publication typically gains 1 189 views.
  • Reactions and interaction: The audience actively supports content: the average number of reactions per post is 10.
  • Thematic interests: Content is focused on key topics such as مدل, مصنوعی, llm, استدلال, مغز.

📝 Description and content policy

The author describes the resource as a platform for expressing subjective opinions:
“اخبار حوزه یادگیری عمیق و هوش مصنوعی مقالات و یافته های جدید یادگیری عمیق بینایی ماشین و پردازش تصویر TensorFlow, Keras, Deep Learning, Computer Vision سایت: http://class.vision 👨‍💻👩‍💻پشتیبان دوره ها: @classvision_support لینک گروه: @tf2kera...”

Thanks to the high frequency of updates (latest data received on 07 October, 2026), the channel maintains relevance and a high level of publication reach. Analytics show that the audience actively interacts with content, making it an important point of influence in the Technologies & Applications category.

15 109
Subscribers
-124 hours
-167 days
No data30 days
Attracting Subscribers
Oct '26
October '26
+5
in 0 channels
September '26
+83
in 1 channels
Get PRO
August '26
+176
in 2 channels
Get PRO
July '26
+86
in 1 channels
Get PRO
June '26
+104
in 1 channels
Get PRO
May '26
+22
in 0 channels
Get PRO
April '26
+22
in 0 channels
Get PRO
March '26
+8
in 0 channels
Get PRO
February '26
+29
in 0 channels
Get PRO
January '26
+13
in 0 channels
Get PRO
December '25
+62
in 1 channels
Get PRO
November '25
+281
in 23 channels
Get PRO
October '25
+201
in 15 channels
Get PRO
September '25
+265
in 21 channels
Get PRO
August '25
+284
in 16 channels
Get PRO
July '25
+165
in 3 channels
Get PRO
June '25
+64
in 5 channels
Get PRO
May '25
+236
in 9 channels
Get PRO
April '25
+123
in 3 channels
Get PRO
March '25
+164
in 10 channels
Get PRO
February '25
+153
in 7 channels
Get PRO
January '25
+136
in 5 channels
Get PRO
December '24
+100
in 1 channels
Get PRO
November '24
+247
in 4 channels
Get PRO
October '24
+353
in 10 channels
Get PRO
September '24
+239
in 6 channels
Get PRO
August '24
+250
in 6 channels
Get PRO
July '24
+230
in 7 channels
Get PRO
June '24
+182
in 2 channels
Get PRO
May '24
+1 045
in 16 channels
Get PRO
April '24
+533
in 17 channels
Get PRO
March '24
+364
in 3 channels
Get PRO
February '24
+453
in 5 channels
Get PRO
January '24
+753
in 12 channels
Get PRO
December '23
+837
in 15 channels
Get PRO
November '23
+416
in 17 channels
Get PRO
October '23
+223
in 9 channels
Get PRO
September '23
+296
in 0 channels
Get PRO
August '23
+226
in 0 channels
Get PRO
July '23
+144
in 0 channels
Get PRO
June '23
+229
in 0 channels
Get PRO
May '23
+135
in 0 channels
Get PRO
April '23
+166
in 0 channels
Get PRO
March '23
+189
in 0 channels
Get PRO
February '23
+132
in 0 channels
Get PRO
January '23
+149
in 0 channels
Get PRO
December '22
+101
in 0 channels
Get PRO
November '22
+124
in 0 channels
Get PRO
October '22
+132
in 0 channels
Get PRO
September '22
+185
in 0 channels
Get PRO
August '22
+231
in 0 channels
Get PRO
July '22
+180
in 0 channels
Get PRO
June '22
+106
in 0 channels
Get PRO
May '22
+347
in 0 channels
Get PRO
April '22
+291
in 0 channels
Get PRO
March '22
+74
in 0 channels
Get PRO
February '22
+90
in 0 channels
Get PRO
January '22
+165
in 0 channels
Get PRO
December '21
+87
in 0 channels
Get PRO
November '21
+208
in 0 channels
Get PRO
October '21
+140
in 0 channels
Get PRO
September '21
+267
in 0 channels
Get PRO
August '21
+103
in 0 channels
Get PRO
July '21
+167
in 0 channels
Get PRO
June '21
+175
in 0 channels
Get PRO
May '21
+213
in 0 channels
Get PRO
April '21
+147
in 0 channels
Get PRO
March '21
+87
in 0 channels
Get PRO
February '21
+270
in 0 channels
Get PRO
January '21
+86
in 0 channels
Get PRO
December '20
+6 203
in 0 channels
Date
Subscriber Growth
Mentions
Channels
07 October0
06 October0
05 October0
04 October+3
03 October+1
02 October0
01 October+1
Channel Posts
مهلت استفاده تا پایان این هفته است

2
‏🎯 Jev‏ کجا به درد می‌خورد و کجا نه؟ ‏Jev‏ بیشتر از اینکه جای GPT‏ یا Claude‏ را بگیرد، می‌تواند یک «لایه‌ی تصمیم‌گیری» سریع و ارزان باشد. یعنی برای کارهای کوچک و پرتعداد که الان بی‌خودی برای هرکدام یک مدل بزرگ صدا می‌زنیم. ‏تقسیم کار پیشنهادی (Separation of Concerns‏): ‏• تصمیم‌های کوچک و پرتعداد ← Jev ‏• تحلیل، reasoning‏ و تولید محتوا ← GPT / Claude / Gemini‏ ‏• قوانین قطعی، محاسبات و محدودیت‌های حساس ← Code‏ ‏• تصمیم‌های پرریسک ← انسان ‏نمونه کاربردها: ‏• CRM‏: دسته‌بندی مشتری‌ها بر اساس احتمال ریزش، اهمیت یا نوع درخواست ‏• Support‏ و Lead Scoring‏: تشخیص فوریت، تیم مناسب و ارزش سرنخ‌ها ‏• Agent Routing‏: انتخاب agent‏، tool‏ یا مدل مناسب قبل از شروع کار سنگین ‏• RAG‏: حذف اسناد کم‌ربط و re-rank‏ نتایج ‏• QA‏ و Moderation‏: بررسی کیفیت، ارتباط و ریسک خروجی مدل‌ها، و پرچم‌گذاری محتوای مشکوک ‏• Workflow Automation‏: تعیین شاخه‌ی فرایند برای هر درخواست ‏• باشگاه مشتریان و بازاریابی: انتخاب نوع پیشنهاد، تخفیف یا کمپین مناسب هر گروه ‏⚠️ اما Jev‏ «خیلی باهوش‌تر» نیست؛ برای یک نوع خاص از هوش بهینه شده و روی مسئله‌های مبهم افت می‌کند. دو نمونه: ‏1️⃣ Browser automation‏ ‏تیم WebMCP‏ (Idan Levin‏) با ترکیب Jev‏ و WebMCP‏ همه‌ی 49 task‏ را حل کرد. ولی این ترکیب دو مدل بود: Jev‏ ابزار را انتخاب می‌کرد و یک LLM‏ سریع (Mercury 2.5‏) آرگومان‌ها را می‌نوشت، چون Jev‏ متن تولید نمی‌کند. وقتی Jev‏ مستقیم با کنترل‌های صفحه مرورگر را می‌راند، فقط 25 از 49 task‏ حل شد. خود نویسندگان می‌گویند این نتیجه‌ی harness‏ آن‌هاست و سقف عمومی Jev‏ نیست. ‏2️⃣ تشخیص phishing‏ ‏در یک benchmark‏ مستقل روی 2000 ایمیل (ایمیل‌های synthetic‏)، دقت مستقیم Jev‏ فقط 62.6٪ بود و Claude Haiku 4.5‏ به 81.3٪ رسید. ‏ولی وقتی همان مسئله به 5 سؤال ساده‌تر شکسته شد (مثلاً: لینک به free hosting‏ اشاره دارد؟ فشار و فوریت دارد؟)، یک رگرسیون لجستیک روی جواب‌های Jev‏ به 95.1٪ رسید. حتی یک قانون ثابت روی یکی از این سیگنال‌ها 89.5٪ می‌داد. ‏در همین تست Jev‏ حدود 3 برابر سریع‌تر (239ms‏ در برابر 687ms‏) و حدود 12 برابر ارزان‌تر ($0.038 در برابر $0.462 برای هر هزار ایمیل) از Haiku‏ بود. یعنی در مقایسه با یک مدل سبک، ضریب‌ها خیلی کمتر از «40x‏ تا 200x‏» است. ‏پس جای درست Jev‏ «مغز کل سیستم» نیست، بلکه یک قطعه‌ی سریع برای تصمیم‌های محدود داخل یک معماری بزرگ‌تر است. اگر یک استارتاپ هزاران تصمیم کوچک، تکراری و مشخص دارد، جذاب است. هرچه تصمیم مبهم‌تر، چندمرحله‌ای‌تر یا پرریسک‌تر شود، بهتر است به یک مدل قوی‌تر یا انسان سپرده شود. ‏منابع: ‏https://madewithjev.com/builds/webmcp-benchmark ‏https://github.com/anisselbd/jev-phishing-bench
3 403
3
‏🧠 Jev از TypeSafe AI‏؛ مدلی که متن نمی‌نویسد، تصمیم می‌گیرد ‏TypeSafe AI روز ۱۵ سپتامبر ۲۰۲۶ با ۴۰ میلیون دلار سرمایه معرفی شد و اولین مدلش، Jev‏، را در حالت early access‏ (با waitlist‏) عرضه کرد. بنیان‌گذار و CEO آن، Diogo Almeida‏، سابقه‌ی کار در OpenAI‏ دارد و از نویسندگان مقاله‌ی InstructGPT‏ است. ‏ایده جالب است: به‌جای ساختن یک LLM‏ بهتر برای تولید متن، مدلی بسازیم که مستقیم برای تصمیم‌گیری داخل نرم‌افزار طراحی شده. ‏**مشکل کجاست؟** ‏LLMها برای chat‏ عالی‌اند، ولی در automation‏ هنوز دردسر دارند: خروجی string‏ است و باید parse‏ و validate‏ شود، latency‏ بالاست و confidence‌ای که خودشان می‌دهند همیشه قابل اعتماد نیست. ‏**Jev‏ چه می‌کند؟** ‏Jev از دسته‌ی جدیدی به اسم System One Models**‏ است (نامش از تمایز System 1‏ و System 2‏ دنیل کانمن آمده): ‏• ورودی: متن یا state‏ نامرتب (مثلاً JSON‏) + مجموعه‌ای سؤال تایپ‌شده ‏• خروجی: از قبل type‏ مشخص دارد؛ انتخاب بین گزینه‌ها (`Choice`‏)، امتیاز (`Score`‏) یا بله/خیر با احتمال (`Noul`‏)، همراه با confidence‏ ‏• همه‌ی سؤال‌ها در یک query‏ و به‌صورت موازی جواب داده می‌شوند، نه توکن‌به‌توکن مثل LLMهای autoregressive‏ ‏آموزش هم با روشی به اسم **RLCD**‏ (Reinforcement Learning for Calibrated Decisions‏) انجام شده. هدفش این است که احتمال‌ها واقعاً معنی داشته باشند: وقتی مدل می‌گوید ۹۰٪ مطمئنم، انتظار می‌رود تقریباً در ۹۰٪ موارد مشابه درست باشد. ‏**ادعاهای شرکت: ‏• latency‏ حدود 70 تا 500 میلی‌ثانیه، یعنی 40x‏ تا 200x‏ سریع‌تر از LLMهای frontier‏ در taskهای System One‏ ‏• قیمت `$0.042` برای هر یک میلیون توکن ورودی؛ خروجی رایگان ‏• «no type errors‏»: چون خروجی از قبل schema‏ دارد، مدل نمی‌تواند مقداری خارج از ساختار تعریف‌شده برگرداند ‏⚠️ «no type errors‏» یعنی خروجی type-safe‏ است، نه اینکه «هیچ‌وقت اشتباه نمی‌کند». تصمیم می‌تواند از نظر ساختار کاملاً معتبر باشد و باز هم غلط. بیشتر اعداد بالا هم از benchmarkهای خود شرکت است. ‏منبع: ‏https://typesafe.ai/blog/introducing-system-one-models-and-jev
2 659
4
🧠 Jev از TypeSafe AI؛ مدلی که متن نمی‌نویسد، تصمیم می‌گیرد TypeSafe AI روز ۱۵ سپتامبر ۲۰۲۶ با ۴۰ میلیون دلار سرمایه معرفی شد و اولین مدلش، Jev، را در حالت early access (با waitlist) عرضه کرد. بنیان‌گذار و CEO آن، Diogo Almeida، سابقه‌ی کار در OpenAI دارد و از نویسندگان مقاله‌ی InstructGPT است. ایده جالب است: به‌جای ساختن یک LLM بهتر برای تولید متن، مدلی بسازیم که مستقیم برای تصمیم‌گیری داخل نرم‌افزار طراحی شده. مشکل کجاست؟ LLMها برای chat عالی‌اند، ولی در automation هنوز دردسر دارند: خروجی string است و باید parse و validate شود، latency بالاست و confidence‌ای که خودشان می‌دهند همیشه قابل اعتماد نیست. Jev چه می‌کند؟ Jev از دسته‌ی جدیدی به اسم System One Models است (نامش از تمایز System 1 و System 2 دنیل کانمن آمده): - ورودی: متن یا state نامرتب (مثلاً JSON) + مجموعه‌ای سؤال تایپ‌شده - خروجی: از قبل type مشخص دارد؛ انتخاب بین گزینه‌ها (Choice)، امتیاز (Score) یا بله/خیر با احتمال (Noul)، همراه با confidence - همه‌ی سؤال‌ها در یک query و به‌صورت موازی جواب داده می‌شوند، نه توکن‌به‌توکن مثل LLMهای autoregressive آموزش هم با روشی به اسم RLCD (Reinforcement Learning for Calibrated Decisions) انجام شده. هدفش این است که احتمال‌ها واقعاً معنی داشته باشند: وقتی مدل می‌گوید ۹۰٪ مطمئنم، انتظار می‌رود تقریباً در ۹۰٪ موارد مشابه درست باشد. ادعاهای شرکت: - latency حدود 70 تا 500 میلی‌ثانیه، یعنی 40x تا 200x سریع‌تر از LLMهای frontier در taskهای System One - قیمت $0.042 برای هر یک میلیون توکن ورودی؛ خروجی رایگان - «no type errors»: چون خروجی از قبل schema دارد، مدل نمی‌تواند مقداری خارج از ساختار تعریف‌شده برگرداند ⚠️ «no type errors» یعنی خروجی type-safe است، نه اینکه «هیچ‌وقت اشتباه نمی‌کند». تصمیم می‌تواند از نظر ساختار کاملاً معتبر باشد و باز هم غلط. بیشتر اعداد بالا هم از benchmarkهای خود
2
5
🍂 به مناسبت شروع ماه مهر تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف میتوانید تهیه کنید: 📌 ۱ دوره از سای
🍂 به مناسبت شروع ماه مهر تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف میتوانید تهیه کنید: 📌 ۱ دوره از سایت کلاس ویژن 🧠 دوره آموزشی ویدیویی Graph Neural Network 📚 3 دوره از کلاس ویژن در مکتب‌خونه 🤖 آموزش Agentic AI با پایتون 🧠 آموزش هوش مصنوعی مولد با مدل‌های زبانی بزرگ (LLM) 👁 آموزش مدل‌های زبانی-تصویری (VLM): از درک تصویر و ویدیو تا فاین‌تیون پیشرفته ⏳ تخفیف ۷۰٪ فقط تا پایان هفته اول مهر (با کلیک روی هر لینک کد تخفیف را مشاهده نمایید.)
2 932
6
🍂 به مناسبت شروع ماه مهر تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف قرار خواهیم داد: 📌 ۱ دوره از سایت ک
🍂 به مناسبت شروع ماه مهر تا پایان هفته اول مهر، ۴ دوره آموزشی کلاس ویژن را با ۷۰٪ تخفیف قرار خواهیم داد: 📌 ۱ دوره از سایت کلاس ویژن 🧠 دوره آموزشی ویدیویی Graph Neural Network 📚 3 دوره از کلاس ویژن در مکتب‌خونه 🤖 آموزش Agentic AI با پایتون 🧠 آموزش هوش مصنوعی مولد با مدل‌های زبانی بزرگ (LLM) 👁 آموزش مدل‌های زبانی-تصویری (VLM): از درک تصویر و ویدیو تا فاین‌تیون پیشرفته ⏳ تخفیف ۷۰٪ فقط تا پایان هفته اول مهر (با کلیک روی هر لینک کد تخفیف را مشاهده نمایید.)
1
7
دنیایی از منابع برنامه‌نویسی توی این کانال بصورت دسته‌بندی شده با هشتگ بصورت روزانه قرار داده میشه. @pythony
دنیایی از منابع برنامه‌نویسی توی این کانال بصورت دسته‌بندی شده با هشتگ بصورت روزانه قرار داده میشه. @pythony
3 327
8
🤖 می‌خوای Agent بسازی، نه فقط با AI چت کنی؟ تصور کن مدلی داشته باشی که ابزار صدا بزنه، مسئله رو مرحله‌به‌مرحله بشکنه و برای
🤖 می‌خوای Agent بسازی، نه فقط با AI چت کنی؟ تصور کن مدلی داشته باشی که ابزار صدا بزنه، مسئله رو مرحله‌به‌مرحله بشکنه و برای انجام یه کار واقعی خودش تصمیم بگیره. توی دوره Agentic AI با پایتون قدم‌به‌قدم یاد می‌گیری: 🔹 Workflow و Tool Use 🔹 MCP 🔹 سیستم‌های چندعامله (Multi-Agent) 🔹 LangChain اگه پایتون بلدی و می‌خوای وارد دنیای ساخت AI Agentها بشی، این دوره برات ساخته شده. 🎁 تخفیف ۷۰٪ فقط تا اول مهر (تعداد محدود) 🎟 کد تخفیف: COUPON-8759A 👇 ثبت‌نام: 🔗 https://mktb.me/m6tt/ 💻 کدهای دوره روی گیت‌هاب: https://github.com/Alireza-Akhavan/agentic_ai @agentic_llm
2 892
9
🎨 GPT Image 2.5 منتشر شد؛ چه چیزی بهتر شده؟ OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی سرعت و ویرایش دقیق‌تر تصاویر عرضه
🎨 GPT Image 2.5 منتشر شد؛ چه چیزی بهتر شده؟ OpenAI نسل جدید مدل تصویرسازش را با تمرکز روی سرعت و ویرایش دقیق‌تر تصاویر عرضه کرده. مهم‌ترین تغییرات 👇 ⚡️ تولید تصویر تا حدود ۲ برابر سریع‌تر 🖼️ حفظ بهتر چهره، محصول و سوژه‌ی تصویر مرجع ✏️ ویرایش‌های چندمرحله‌ای با تغییر کمتر در بخش‌های دیگر تصویر ✨ نور، بافت و پس‌زمینه شفاف بهتر 💰 قیمت هر توکن نسبت به GPT Image 2 تغییر نکرده در API هم دو نسخه داریم: Flare → سریع‌تر و مناسب استفاده روزمره Sunburst → مناسب خروجی نهایی و ویرایش‌های دقیق‌تر نکته مهم برای توسعه‌دهنده‌ها: اگر از API استفاده می‌کنید، مقدار quality را حتماً مشخص کنید؛ چون سطح‌های کیفیت در نسخه 2.5 نسبت به نسل قبل تغییر کرده‌اند. در مجموع GPT Image 2.5 یک انقلاب جدید نیست؛ بیشتر یک ارتقای جدی در سرعت، ثبات و کنترل ویرایش تصویر است. 🚀 🌀 @cvision 🌀
3 152
10
معرفی 🚀 GPT-6 Astra اوپن‌ای‌آی امروز از GPT-6 Astra رونمایی کرد؛ مدلی که این شرکت آن را هوشمندترین و هم‌راستاترین مدل خود تا
معرفی 🚀 GPT-6 Astra اوپن‌ای‌آی امروز از GPT-6 Astra رونمایی کرد؛ مدلی که این شرکت آن را هوشمندترین و هم‌راستاترین مدل خود تا امروز معرفی می‌کند. آسترا 🧠 در حوزه‌هایی مثل برنامه‌نویسی، کار با کامپیوتر و مرورگر، پژوهش علمی، امنیت سایبری و انجام کارهای حرفه‌ای چندمرحله‌ای پیشرفت قابل‌توجهی داشته است. یکی از مهم‌ترین تغییرات این نسل، توانایی بسیار بهتر در انجام مستقل کارهاست؛ یعنی مدل می‌تواند با نرم‌افزارها و وب‌سایت‌ها کار کند، فرم‌ها را تکمیل کند، داده‌ها را تحلیل کند، سند و فایل اکسل بسازد، وب‌سایت ایجاد کند و بسیاری از فرایندهای چندمرحله‌ای را با دخالت کمتر کاربر پیش ببرد. عملکرد 📊 آسترا در برخی بنچمارک‌ها هم چشمگیر است؛ این مدل در FrontierMath Tier 4 حدود ۹۸٪، در ARC-AGI-3 حدود ۹۹٫۹٪ و در ExploitBench امتیاز ۱۰۰٪ کسب کرده است. دسترسی آن طی روزهای آینده برای کاربران Plus، Pro، Business و Enterprise نیز گسترده‌تر خواهد شد. 🔗 منبع OpenAI 🔗
4 135
11
🔥 رقابت غول‌های تولید ویدئو با هوش مصنوعی! چند روز پیش یک رقابت جذاب بین تعدادی از مطرح‌ترین مدل‌های تولید ویدئوی AI برگزار
🔥 رقابت غول‌های تولید ویدئو با هوش مصنوعی! چند روز پیش یک رقابت جذاب بین تعدادی از مطرح‌ترین مدل‌های تولید ویدئوی AI برگزار شد: 🎬 Seedance 2.5 🎬 WAN 3 🎬 FLUX 3 🎬 Minimax H3 🎬 Seedance 2.0 🎬 Seedance 2.0 Mini 🎬 Kling 3 Omni 🎬 Grok Imagine 1.5 اما نکته جذاب اینجاست که شرایط برای همه کاملاً یکسان بود: ✅ یک پرامپت مشترک ✅ ۷ تصویر مرجع یکسان ✅ انتخاب اولین ویدئوی تولیدشده توسط هر مدل ❌ بدون گزینش دستی ❌ بدون تدوین و ویرایش ❌ بدون تقویت یا اصلاح صدا یعنی چیزی که می‌بینید، خروجی واقعی مدل‌ها در یک شرایط برابر است. 👀 حالا سؤال اصلی: 🏆 کدوم مدل تونست بهترین خروجی رو ارائه بده؟ 🌀 @cvision 🌀
4 525
12
from google import genai client = genai.Client() # Upload audio file via the Files API audio_file = client.files.upload(file="path/to/audio.wav") # Transcribe with speaker diarization and word timestamps interaction = client.interactions.create( model="gemini-3.5-transcribe", input=[{ "type": "audio", "uri": audio_file.uri, "mime_type": audio_file.mime_type, }], generation_config={ "transcription_config": { "language_codes": ["en-US"], "custom_vocabulary": ["Gemini", "Transcribe"], "mode": { "type": "verbatim", "diarization_mode": "speaker", "timestamp_granularities": ["word"], } } } ) print(interaction.output_text) Get your api key
3 668
13
� مدعی جدید دنیای تولید ویدیو از راه رسید! 🎬🔥 هوش مصنوعی جدید علی‌بابا، Wan 3.0، با قابلیت تولید ویدیوهای سینمایی و واقع‌گر
� مدعی جدید دنیای تولید ویدیو از راه رسید! 🎬🔥 هوش مصنوعی جدید علی‌بابا، Wan 3.0، با قابلیت تولید ویدیوهای سینمایی و واقع‌گرایانه وارد رقابت شده؛ مدلی که می‌تونه از متن و تصویر، ویدیوهای باکیفیت و جذاب تولید کنه و کنترل بیشتری روی حرکت، دوربین و جزئیات صحنه در اختیار کاربر بذاره. اگه دنبال ساخت ویدیوهای حرفه‌ای با هوش مصنوعی هستی، Wan 3.0 یکی از مدل‌هاییه که ارزش امتحان کردن داره. � @cvision
3 325
14
مدل جدید در مکالمه‌های واقعی می‌تواند مکث‌ها و کلمات اضافه مثل «اِمم» را حذف کند، اصلاح جمله توسط گوینده را متوجه شود و متن را به‌صورت خودکار فرمت کند. همچنین امکان تعریف Custom Vocabulary برای اصطلاحات تخصصی و نام‌های خاص هم وجود دارد؛ قابلیتی که برای کاربردهای سازمانی و فنی اهمیت زیادی دارد. 📝⚡️ یکی از جذاب‌ترین بخش‌ها، پشتیبانی از بیش از ۸۵ زبان، تشخیص لهجه‌ها و جابه‌جایی بین زبان‌هاست. برای فایل‌های ضبط‌شده هم قابلیت تشخیص گوینده و Word-level Timestamp در نظر گرفته شده و مدل می‌تواند تا سه گوینده را تفکیک کند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. 🌍🎧 برای کاربردهای Real-time هم گوگل نسخه‌ی جداگانه‌ی gemini-3.5-transcribe-live را از طریق Live API ارائه کرده که برای Voice Agentها، زیرنویس زنده و اپلیکیشن‌های تعاملی طراحی شده و Latency زیر یک ثانیه را هدف قرار می‌دهد. نسخه‌ی دیگر هم برای پردازش فایل‌های ضبط‌شده، جلسات و تماس‌ها در دسترس است. 🚀 از نظر بنچمارک هم اعداد جالب‌اند؛ طبق داده‌ای که گوگل با استناد به Artificial Analysis منتشر کرده، میانگین WER حدود ۴٪ در حالت Streaming و ۲.۶٪ در حالت Non-streaming گزارش شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰٪ بهبود داشته است. 📊 نکته‌ی مهم‌تر این است که گوگل Transcribe را صرفاً به چشم یک موتور STT نمی‌بیند. این مدل در بعضی تجربه‌های Gemini می‌تواند با Context صفحه و مدل‌های دیگر ترکیب شود؛ یعنی فرمان صوتی در آینده فقط برای «تایپ با صدا» نیست و می‌تواند بخشی از رابط اصلی تعامل با AI Agentها باشد. 🤖🎤 فعلاً دسترسی توسعه‌دهندگان به Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio به‌صورت Public Preview فراهم شده؛ این فناوری در Gemini روی macOS و قابلیت Rambler اندروید هم استفاده می‌شود و گوگل گفته پشتیبانی آن در Chrome نیز در راه است. 🧪🌐 به‌نظر می‌رسد رقابت مدل‌های صوتی حالا از «چه کسی دقیق‌تر صدا را متن می‌کند؟» عبور کرده و به سؤال بزرگ‌تری رسیده: چه کسی بهتر می‌تواند منظور کاربر را از صدا بفهمد و آن را مستقیماً به عمل تبدیل کند؟ 👀
3 359
15
گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Spe
گوگل یک قدم جدی‌تر وارد رقابت تبدیل صدا به متن شد 🎙🧠 گوگل مدل جدید Gemini 3.5 Transcribe را معرفی کرده؛ مدلی تخصصی برای Speech-to-Text که به گفته‌ی گوگل، دقیق‌ترین مدل تبدیل گفتار به متن این شرکت تا امروز است. نکته مهم اینجاست که هدف فقط تبدیل کلمه‌به‌کلمه‌ی صدا نیست؛ مدل تلاش می‌کند خروجی را به شکل تمیز، ساختاریافته و قابل استفاده تحویل دهد.
2 878
16
🔥 ۵۰۰ دوره آموزشی مکتب‌خونه رایگان شد! اگه برنامه‌نویسی، به دنیای هوش مصنوعی علاقه داری یا می‌خوای مهارت‌های فنی‌ات رو تقویت
🔥 ۵۰۰ دوره آموزشی مکتب‌خونه رایگان شد! اگه برنامه‌نویسی، به دنیای هوش مصنوعی علاقه داری یا می‌خوای مهارت‌های فنی‌ات رو تقویت کنی، بین این دوره‌ها انتخاب‌های زیادی داری: 🐍 پایتون، توسعه وب و طراحی سایت 🤖 هوش مصنوعی، یادگیری ماشین و علم داده 🖥 کامپیوتر، لینوکس، شبکه و امنیت دوره «یادگیری ماشین با پایتون» با تدریس جادی هم بین آموزش‌های رایگان این طرحه. فقط تا ۸ شهریور فرصت داری؛ از طریق لینک زیر آموزش دلخواهت رو انتخاب کنی و با وارد کردن کد IRANMAHER، با تخفیف ۱۰۰٪ ثبت‌نامش کنی👇 🔗 لینک: https://mktb.me/0be0/
1 053
17
یک خبر خوب برای اونایی که مدت‌هاست می‌خوان یه مهارت جدید یاد بگیرن 👇 با همکاری مکتب‌خونه، ۵۰۰ دوره آموزشی به‌صورت رایگان در
یک خبر خوب برای اونایی که مدت‌هاست می‌خوان یه مهارت جدید یاد بگیرن 👇 با همکاری مکتب‌خونه، ۵۰۰ دوره آموزشی به‌صورت رایگان در طرح «ایران‌ماهر» در دسترس قرار گرفته. 🎓 چند تا از دوره‌های #کلاس_ویژن هم در این طرح قرار دادیم تا اگر تا امروز فرصت یا امکان تهیه‌شون رو نداشتید، بتونید با یکی از اون‌ها شروع کنید. 🌱 🔹 آموزش جامع یادگیری عمیق 🔹 ساخت هوش مصنوعی شخصی در مرورگر 🔹 آموزش مدل‌های زبانی-تصویری 🔹 آموزش پردازش تصویر برای استفاده از این طرح، کافیه موقع ثبت‌نام کد IRANMAHER رو وارد کنید. اگر مدت‌هاست دنبال یه فرصت برای یادگیری و شروع یک مهارت جدید هستید، این فرصت می‌تونه شروع خوبی باشه. ❤️ https://mktb.me/szs2/
3 039
18
🎙 ـTypeless؛ ابزاری که تایپ کردن رو خیلی کمتر می‌کنه Typeless یک ابزار مبتنی بر هوش مصنوعیه که صحبت شما رو به متن تبدیل می‌ک
🎙 ـTypeless؛ ابزاری که تایپ کردن رو خیلی کمتر می‌کنه Typeless یک ابزار مبتنی بر هوش مصنوعیه که صحبت شما رو به متن تبدیل می‌کنه، اما نه به شکل ساده‌ی Voice to Text. هنگام صحبت، تپق‌ها، تکرارها و اصلاحاتی که وسط جمله انجام می‌دید رو تشخیص می‌ده و در نهایت یک متن مرتب و قابل استفاده تحویل می‌ده. مثلاً اگر بگید: «جلسه رو بذاریم فردا... نه، بهتره پس‌فردا ساعت ۱۰ باشه» خروجی نهایی می‌تونه این باشه: «جلسه را برای پس‌فردا ساعت ۱۰ تنظیم کنیم.» یکی از قابلیت‌های جالبش اینه که می‌تونه متن رو متناسب با فضای کاری شما تنظیم کنه؛ مثلاً برای ایمیل، پیام یا متن‌های روزمره. همچنین از بیش از ۱۰۰ زبان پشتیبانی می‌کنه و نسخه‌های Windows، macOS، iOS و Android هم داره. اگر زیاد با ایمیل، پیام، تولید محتوا یا نوشتن متن‌های کاری سروکار دارید، Typeless می‌تونه ابزار جالبی برای امتحان کردن باشه. 🔗 typeless.com
4 480
19
🚀 معرفی مدل ویدیوساز قدرتمند و جدید MiniMax H3 مدل هوش مصنوعی MiniMax H3 (که به عنوان Hailuo 3.0 هم شناخته می‌شود) به تازگی
🚀 معرفی مدل ویدیوساز قدرتمند و جدید MiniMax H3 مدل هوش مصنوعی MiniMax H3 (که به عنوان Hailuo 3.0 هم شناخته می‌شود) به تازگی به صورت Open-Weights منتشر شده و امکانات بی‌نظیری را برای تولید محتوای ویدیویی در اختیار کاربران قرار داده است. این مدل توانایی رقابت با بهترین مدل‌های بسته بازار را دارد و حتی روی سیستم‌های لوکال (مثل ComfyUI) هم قابل اجراست. *خبرخوب : به زودی براتون بصورت اختصاصی ورک فلو ها و مدل های خوبش رو قرار میدهیم*
4 255
20
👁 درک عمیق و هوشمند ویدیوها با اسکیل /watch با اضافه کردن این اسکیل قدرتمند، Agentهای هوش مصنوعی شما (مثل Claude Code و Codex) قابلیت تماشا و تحلیل جامع ویدیوها رو پیدا می‌کنن! ویژگی‌های کلیدی: 🎞 آنالیز فریم‌به‌فریم: درک دقیق و بصری از اتفاقات داخل تصویر. 🗣 تشخیص هوشمند گفتار: فهم کامل دیالوگ‌ها و صدای روی ویدیو. ⚡️ راه‌اندازی تمام‌خودکار: بدون درگیری با مراحل نصب؛ فقط فایل رو به Agent خودتون بدید تا خودش پیش‌نیازها رو بررسی کنه و تمام ابزارهای لازم رو نصب و اجرا کنه.
4 290