Tensorflow(@CVision)
اخبار حوزه یادگیری عمیق و هوش مصنوعی مقالات و یافته های جدید یادگیری عمیق بینایی ماشین و پردازش تصویر TensorFlow, Keras, Deep Learning, Computer Vision سایت: http://class.vision 👨💻👩💻پشتیبان دوره ها: @classvision_support لینک گروه: @tf2keras
نمایش بیشتر📈 تحلیل کانال تلگرام Tensorflow(@CVision)
کانال Tensorflow(@CVision) (@cvision) در بخش زبانی فارسی بازیگری فعال است. در حال حاضر جامعه شامل 15 109 مشترک است و جایگاه 8 263 را در دسته فناوری و برنامهها و رتبه 21 715 را در منطقه إيران دارد.
📊 شاخصهای مخاطب و پویایی
از زمان ایجاد در невідомо، پروژه رشد سریعی داشته و 15 109 مشترک جذب کرده است.
بر اساس آخرین دادهها در تاریخ 06 اکتبر, 2026، کانال فعالیت پایداری دارد. در ۳۰ روز گذشته تغییر اعضا برابر 0 و در ۲۴ ساعت گذشته برابر -1 بوده و همچنان دسترسی گستردهای حفظ شده است.
- وضعیت تأیید: تأیید نشده
- نرخ تعامل (ER): میانگین تعامل مخاطب 12.93% است و در ۲۴ ساعت نخست پس از انتشار، محتوا معمولاً 7.87% واکنش نسبت به کل مشترکان کسب میکند.
- دسترسی پستها: هر پست به طور میانگین 1 954 بازدید دریافت میکند. در اولین روز معمولاً 1 189 بازدید جمعآوری میشود.
- واکنشها و تعامل: مخاطبان بهطور فعال حمایت میکنند؛ میانگین واکنش به هر پست 10 است.
- علایق موضوعی: محتوا بر موضوعات کلیدی مانند مدل, مصنوعی, llm, استدلال, مغز تمرکز دارد.
📝 توضیح و سیاست محتوایی
نویسنده این فضا را محل بیان دیدگاههای شخصی توصیف میکند:
“اخبار حوزه یادگیری عمیق و هوش مصنوعی
مقالات و یافته های جدید یادگیری عمیق
بینایی ماشین و پردازش تصویر
TensorFlow, Keras, Deep Learning, Computer Vision
سایت:
http://class.vision
👨💻👩💻پشتیبان دوره ها:
@classvision_support
لینک گروه:
@tf2kera...”
به لطف بهروزرسانیهای پرتکرار (آخرین داده در تاریخ 07 اکتبر, 2026)، کانال همواره بهروز و دارای دسترسی بالاست. تحلیلها نشان میدهد مخاطبان بهطور فعال با محتوا تعامل دارند و آن را به نقطه اثرگذاری مهم در دسته فناوری و برنامهها تبدیل کردهاند.
$0.038 در برابر $0.462 برای هر هزار ایمیل) از Haiku بود. یعنی در مقایسه با یک مدل سبک، ضریبها خیلی کمتر از «40x تا 200x» است.
پس جای درست Jev «مغز کل سیستم» نیست، بلکه یک قطعهی سریع برای تصمیمهای محدود داخل یک معماری بزرگتر است. اگر یک استارتاپ هزاران تصمیم کوچک، تکراری و مشخص دارد، جذاب است. هرچه تصمیم مبهمتر، چندمرحلهایتر یا پرریسکتر شود، بهتر است به یک مدل قویتر یا انسان سپرده شود.
منابع:
https://madewithjev.com/builds/webmcp-benchmark
https://github.com/anisselbd/jev-phishing-benchChoice)، امتیاز (Score) یا بله/خیر با احتمال (Noul)، همراه با confidence
- همهی سؤالها در یک query و بهصورت موازی جواب داده میشوند، نه توکنبهتوکن مثل LLMهای autoregressive
آموزش هم با روشی به اسم RLCD (Reinforcement Learning for Calibrated Decisions) انجام شده. هدفش این است که احتمالها واقعاً معنی داشته باشند: وقتی مدل میگوید ۹۰٪ مطمئنم، انتظار میرود تقریباً در ۹۰٪ موارد مشابه درست باشد.
ادعاهای شرکت:
- latency حدود 70 تا 500 میلیثانیه، یعنی 40x تا 200x سریعتر از LLMهای frontier در taskهای System One
- قیمت $0.042 برای هر یک میلیون توکن ورودی؛ خروجی رایگان
- «no type errors»: چون خروجی از قبل schema دارد، مدل نمیتواند مقداری خارج از ساختار تعریفشده برگرداند
⚠️ «no type errors» یعنی خروجی type-safe است، نه اینکه «هیچوقت اشتباه نمیکند». تصمیم میتواند از نظر ساختار کاملاً معتبر باشد و باز هم غلط. بیشتر اعداد بالا هم از benchmarkهای خودCOUPON-8759A
👇 ثبتنام:
🔗 https://mktb.me/m6tt/
💻 کدهای دوره روی گیتهاب:
https://github.com/Alireza-Akhavan/agentic_ai
@agentic_llm quality را حتماً مشخص کنید؛ چون سطحهای کیفیت در نسخه 2.5 نسبت به نسل قبل تغییر کردهاند.
در مجموع GPT Image 2.5 یک انقلاب جدید نیست؛ بیشتر یک ارتقای جدی در سرعت، ثبات و کنترل ویرایش تصویر است. 🚀
🌀 @cvision 🌀from google import genai
client = genai.Client()
# Upload audio file via the Files API
audio_file = client.files.upload(file="path/to/audio.wav")
# Transcribe with speaker diarization and word timestamps
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}],
generation_config={
"transcription_config": {
"language_codes": ["en-US"],
"custom_vocabulary": ["Gemini", "Transcribe"],
"mode": {
"type": "verbatim",
"diarization_mode": "speaker",
"timestamp_granularities": ["word"],
}
}
}
)
print(interaction.output_text)
Get your api keygemini-3.5-transcribe-live را از طریق Live API ارائه کرده که برای Voice Agentها، زیرنویس زنده و اپلیکیشنهای تعاملی طراحی شده و Latency زیر یک ثانیه را هدف قرار میدهد. نسخهی دیگر هم برای پردازش فایلهای ضبطشده، جلسات و تماسها در دسترس است. 🚀
از نظر بنچمارک هم اعداد جالباند؛ طبق دادهای که گوگل با استناد به Artificial Analysis منتشر کرده، میانگین WER حدود ۴٪ در حالت Streaming و ۲.۶٪ در حالت Non-streaming گزارش شده و زمان رسیدن به متن نهایی نسبت به Chirp 3 حدود ۷۰٪ بهبود داشته است. 📊
نکتهی مهمتر این است که گوگل Transcribe را صرفاً به چشم یک موتور STT نمیبیند. این مدل در بعضی تجربههای Gemini میتواند با Context صفحه و مدلهای دیگر ترکیب شود؛ یعنی فرمان صوتی در آینده فقط برای «تایپ با صدا» نیست و میتواند بخشی از رابط اصلی تعامل با AI Agentها باشد. 🤖🎤
فعلاً دسترسی توسعهدهندگان به Gemini 3.5 Transcribe از طریق Gemini API و Google AI Studio بهصورت Public Preview فراهم شده؛ این فناوری در Gemini روی macOS و قابلیت Rambler اندروید هم استفاده میشود و گوگل گفته پشتیبانی آن در Chrome نیز در راه است. 🧪🌐
بهنظر میرسد رقابت مدلهای صوتی حالا از «چه کسی دقیقتر صدا را متن میکند؟» عبور کرده و به سؤال بزرگتری رسیده: چه کسی بهتر میتواند منظور کاربر را از صدا بفهمد و آن را مستقیماً به عمل تبدیل کند؟ 👀IRANMAHER رو وارد کنید.
اگر مدتهاست دنبال یه فرصت برای یادگیری و شروع یک مهارت جدید هستید، این فرصت میتونه شروع خوبی باشه. ❤️
https://mktb.me/szs2//watch
با اضافه کردن این اسکیل قدرتمند، Agentهای هوش مصنوعی شما (مثل Claude Code و Codex) قابلیت تماشا و تحلیل جامع ویدیوها رو پیدا میکنن!
ویژگیهای کلیدی:
🎞 آنالیز فریمبهفریم: درک دقیق و بصری از اتفاقات داخل تصویر.
🗣 تشخیص هوشمند گفتار: فهم کامل دیالوگها و صدای روی ویدیو.
⚡️ راهاندازی تمامخودکار: بدون درگیری با مراحل نصب؛ فقط فایل رو به Agent خودتون بدید تا خودش پیشنیازها رو بررسی کنه و تمام ابزارهای لازم رو نصب و اجرا کنه.