Otabek’s I/O
前往频道在 Telegram
I write about Backend, Infrastructure, Math, ML/AI, and Computer Science. Building: @voicelabio Contact: ask@otabek.io
显示更多2 848
订阅者
无数据24 小时
+97 天
+1330 天
帖子存档
2 849
Ko'pchilik bir xil savol beradi:
"Model o'zilarnikimi yoki open-source modelmi?"
O'zimizniki ham bor, open source modellarimiz ham bor. Nimaga "pre-train" (ma'lumot yig'ib, PyTorch va JAX code bilan neural networkni tuzish, necha qavatli qilish, attention, yashirin dimension lar va hardware ga mos optimizatsiya qilish, keyin katta model uchun distributed system qilish chunki katta modellar bitta GPU ga sig'maydi, Hyperparameter configuration va h.k.z larni hammasini qilish deganida) qilmaysizlar to'liq ham deyishadi. Odatda javobim bunday.
Pre-training juda og'ir jarayon, ayniqsa low-resource (resursi kam bo'lgan) tillar uchun model qilish undanda og'ir. Ma'lumot yig'ish, tozalash jarayonini o'zi sizni butun umrlik qiynoqqa soladi. Biz bunday holatlarda osonroq yo'ldan ketamiz. Bor modelni olamiz, uni shunchaki post-train (fine-tuning) qilamiz. Bu jarayonda model'dagi og'irlik (weight) qayta balans qilinadi. Bu orqali model yaxshiroq o'rganadi eski ma'lumotlarini. Ya'ni ona tili ustozingiz diktantni faqat bir marta qaytarishi aniqlikni oshiradimi, yoki 2-3 marotabami?
Ikkinchi masala bu "compute". Hozirgi paytda bizga Azure, AWS va GCP zo'rga GPU'lar uchun imtiyoz berishgan. Ba'zilarida H100, H200 yoki B200 kabi kuchli videokartalar topishimiz qiyin bo'lsa, ba'zilarida bor ammo juda qimmat. Startup uchun bu og'ir.
Ammo imkon topayabmiz, modellarimizni yaxshilab borayabmiz. Undan tashqari CPU da ham ishlay oladigan modellarni ustida ishlayabmiz. Jarayondan o'rgangan 2 xulosam bor. Biri pre-train jarayoniga. Ikkinchisi post-training jarayoniga tegishli.
Barcha ma'lumotlarni chalkashtirib (shuffle qilib) keyin ularni boshidan oxirgacha teng distrbute qilish juda xato ekan. Model o'rganish darajasini (Learning rate) train jaryoni oxirida pasaytirish, va yuqori sifatli ma'lumotlarni berish kerak. Chunki aynan shu qismi modelni tugashi va post-training boshlanishi bo'ladi. Model ma'lumotni o'rgandi, endi unga bu ma'lumotni to'g'ri tushunish va ishlatishni o'rgatish (post-training) qismida ham sifatini saqlab qolishi uchun oxirgi ko'rgan ma'lumotlari juda sifatli bo'lishi kerak.
Model aldashni o'rganadi. Agar label qilingan ma'lumot faqat yaxshi tondagi javobga mukofot (reward) olsa, demak u cheat code qilishni boshlaydi. U doim muloyim va ishonchli aldashni boshlaydi. Buni natijasida u hallucinate qiladi, asosiy sabab bitta reward tonga (yoki stilga) nisbatan, haqiqatga (mazmun) emas.
RL muhitda bu tarafga qarash uchun modelni objective test qilish kerak, ya'ni natijani tekshirish oson bo'lishi kerak. Misol uchun "kod compile bo'ldi va to'g'ri ishladimi?", "javob haqiqatdan 42 chiqdimi?", "bergan javobi yaroqli JSONmi yoki nimadir qo'shvordimi?" degan savollarga javob topish. Chunki bularni tekshirsa bo'ladi.
Ovozli modellarda ham huddi shu jarayonni avtomatlashtirsa bo'ladi. Faqat ozgina sabr kerak ekan. Biz buni o'rgandik, bir kun yozish ham nasib qilsin. Uxlanglar endi : )
2 849
Voicelab Desktop V1 chiqdi, har kunlik bepul kreditlar beramiz. Mazza qilib ishlatishingiz mumkin.
voicelab.uz/download
2 849
🎉 Vibe Talking urfga kiradi
Kodni, xabarlarni, va matnlarni qo'lda yozish, o'rta asrlarga xos. VoiceLab Desktop bilan kodni gapirib yozing. Barmoqlarni bukishni bas qiling, ovozli boshqaruvga o'ting.
Ushbu promokod bilan butun ekotizim uchun, Creator tarifiga 70% chegirma oling.
OTABEKSWE (faqat Creator tarifiga ishlaydi)
Mac Apple Silicon | Mac Intel | Linux
2 849
So'ngi vaqtlarda hech qanday post yozmadim. Ammo juda ko'p yaxshi ishlar bo'ldi:
• Biz VoiceLab ni to'liq launch qildik.
• Juda ko'p eksperimentlar qilib qiziq bilim va tajribalar oldik.
• So'ngi modelimizga +30 tadan oshiq tillarni qo'shdik, endi ovozlar qidirayabmiz har xil tillarda (chiroyli ovoz sohib(a)lar)
• Shu orada research paper yozishga ham ulgurdim, buni voicelab blog sahifasini yaratib bo'lishib o'taman
• Soniox, Elevenlabs va boshqa kompaniyalardan bizga qiziqishlar bildirishayabdi (Shaxsan Mati Co-founder @ Elevenlabs tabriklab yozdi)
Xullas, yozish uchun yaxshi bilim va tajribalar olindi. Endi yozishga vaqt topish kerak : )
2 849
Ushbu darslar hayotimga quvonch olib kelgan.
Amerika, Yevropa va hatto Avstraliyada o‘quvchi talabalarning vaqtini saqlab qilibdi. FAANG kompaniyalariga ishga kirishda ham bir necha bor yordami tegdi. Ularni ishga taklif olganiga guvoh bo‘lganman.
Sizga ham foydasi tegsin, esingizdan chiqqan bo‘lsa eslatay degandim. O‘qing!
2 849
AI modellar quryabmiz. Eng katta olgan xulosalarim:
1. Hozirgi modellarda deyarli arxitektura tomonlama o’zgarish yo’q.
2. Yaxshilanishlar data labeling va reinforcement learning muhiti yaratuvchi kompaniyalar xisobiga bo’layabdi.
3. Fable, Sol ham shunchaki bir sohaga fine-tune (yoki CPT) qilingan chuqur.
Ammo modellar o’zgarmasa ham boshqa jarayonlar o’zgarayabdi:
1. Deyarli ko’p agentlar qurgan dasturlada ochiq joylar ko’payabdi.
2. Sifat tushib borayabdi.
3. Hardware kompaniyalar yana inovatsion izlanishlar qilishga kirishyabdi.
Yutishni yagona yo’li hali ham bir xil qolmoqda, fundamental bilimlarni o’rganish.
VoiceLab dagi ba’zi modellarimiz va ilmiy ishlarimizni bo’lishib o’taman keyinroq. Hammaga hayrli kun.
2 849
O'zbek tilida ravon so'zlashuvchi sun'iy intelekt qurishimizda hissa qo'shing. Qanday deysizmi?
Yo berilgan matnni o'qib, yoki o'qilgan matn audiosini tekshirib.
hissa.voicelab.uz
@voicelab_uzbot
Tez kunda yangiligimiz bor.
2 849
🎉 Kichik yangilikcha
Biz Voice Agent, TTS (Text-To-Speech), va STT (Speach-To-Text) modellar quryabmiz. O'zbek tilida ravon, aksentlarsiz, tiniq va tezkor modellar halicha yo'q. Code-switching va shunga o'xshash qiziq muammolar bor.
Biz Elzodxon bilan birga AIsha ovozli modelini yaxshilab, keyingi bosqichda AI Lab qurish ustida ishlaymiz. Agent Inference + Voice Agents = Cooking something.
Qiziquvchilar bo'lsa email yuboring:
ask@otabek.io
2 849
#startup
Texnik qiyin ammo juda katta impact keltiruvchi loyiha qilmoqchimisiz? Sizga men ko'rgan va topgan qiziq muammolarni aytaman. Bular multi-billion dollar startup idealar
1. GPU isolation:
CPU uchun hardware va software level da deyarli ko'plab ishlar qilingan. Ammo GPU larni multi-tenant muhitda ishlatish va izolyatsiya qilish bo'yicha effektiv yechimlar halicha yo'q (shaxsan men ko'rmadim). AI kompaniyalar va Data Center'lar sizga katta mijoz bo'ladi kelajakda.
2. Data cleaning/labeling/formatting automation:
Bugungi kunda AI engineer'lar vaqtining 80 foizini tartibsiz, formati buzilgan yoki takrorlangan ma'lumotlarni tozalashga sarflaydi. "Garbage in, garbage out" qoidasi AI uchun qonun. Qo'lda tozalash sekin va inson omiliga bog'liq, hozirgi yechimlar esa juda ko'p xatolik qiladi. Ma'lumotlar omboriga (S3, BigQuery, Snowflake) kelib tushayotgan petabaytlab ma'lumotlarni real vaqt rejimida anomal qiyofalarini topuvchi, formatini avtomat to'g'rilovchi va multimodal (matn, rasm, video) ma'lumotlarni o'zaro semantic sintaksis bo'yicha bog'lovchi avtonom servis quring. Mijozlaringiz yana o'sha katta o'yinchilar bo'ladi.
3. Data for robotics and physical world AI systems:
Robototexnika (Humanoid robotlar, avtonom transportlar) hozirgi kunda "Sim-to-Real" muammosidan aziyat chekadi. Ya'ni, robot simulyatsiyada (raqamli dunyoda) hamma narsani mukammal bajaradi, lekin uni haqiqiy fizik dunyoga chiqarganda fizik qonunlar, kutilmagan teksturalar va yorug'lik o'zgarishlari tufayli xato qiladi. Real world data yig'ish esa juda qimmat va xavfli. Fizika qonunlari (gravitatsiya, ishqalanish, material elastikligi, gidrodinamika)ga 100% bo'ysunadigan, generative AI'ga asoslangan cheksiz simulyatsiya platformasi qiling. Bu robotlar uchun "Matrix" (kinodagidek) simulyatsiyasini yaratish degani.
4. Storage that can serve static files at scale with scalable network:
bir tanishim bilan "expander graph" haqida gaplashgandik. Agar shu konseptsiyani qila olsangiz Dropbox/Youtube va boshqa katta file serve qiladigan service levelda ish qila olasiz. An'anaviy CDN va Storage tizimlari (AWS S3, Cloudflare) markazlashgan yoki cheklangan geografik serverlarga tayanadi. Katta hajmli fayllarni (masalan, 8K video, 3D xaritalar, gigabaytlab AI model og'irliklari) bir vaqtning o'zida millionlab foydalanuvchiga yetkazishda tarmoq o'tkazuvchanligi (bandwidth) botqoqqa botib qoladi. Bu muammo ham aktual.
Bonus konseptsiya: Matematik bilimingiz zo'r bo'lsa compression algoritmi toping katta ma'lumotlarni (binary ma'lumotlarni) kichiraytiradigan. Petabayt yoki katta masshtabda ma'lumotlarni o'tkazish uchun hozirgi networking jihozlari oqsaydi, bu orqali boshqalarga halaqit qiladi tezlikni sekinlashtirib. Shuning uchun bu ham aktual mavzu.
Nima project qilay deydiganlar, mana qiling endi.
2 849
#offTopic #startup
Ishdan ketib to'liq startap qilish tomon o'tar ekanman ba'zi qiziq narsalarni topdim, va ularni shu yerda yozmoqchiman. Agar siz ham startap qilmoqchi bo'lsangiz, bular haqida albatta o'ylab ko'ring.
Investitsiya juda katta tuzoq. Investorlar "biz founderga pul tikamiz" deyishadi, lekin bir qop qog'oz va biznes haqida ma'lumot so'rashadi. To'g'ri risk qilishni hamma ham yoqtirmaydi, ammo so'zlar to'g'irlanishi kerak deb o'ylayman "founderga tikamiz" -> "yaxshi biznes muammoni yechadigan founderga". Agar bozorni, mijozlaringizni va qurayotgan startapingiz nima muammo qanday yaxshi yechishini bilmasangiz bu yo'lga kirishingiz sizni butunlayin charchatib qo'yadi.
Eng yaxshi asoschilar jamoasini va yechayotgan muammosini yaxshi tushunadiganlari. Eng zo'r muammolarni 1 inson emas, jamoa yechadi. Bu yerda jamoani qo'llab quvatlash juda muhim. Ularni muammosini topib yechim berishingiz ham sizga va kompaniyaga bo'lgan ulardagi iliqlikni oshiradi. Asoschilarda ko'p ko'radigan vaziyatim, ular faqat foyda olishni istaydi, berishni emas. Olganingiz emas, berganingiz sizniki.
Hammasini tashab ketishni o'ylagan kuningiz yechim topiladi. Ochlik juda zo'r qurol. Qancha och bo'lsangiz, shuncha harakatingiz oshadi (albatta ovqat topishga bo'lgan sabablarni qilishni boshlaysiz). Agar pulingiz ko'p bo'lsa, kam harakat bo'lsangiz, qisqacha aytganda komfortda bo'lsangiz ulardan voz keching. Aqlli bo'lsangiz, sizdan aqillilar bilan gaplashing, ahmoqligizni va o'rganishingiz kerakligini tushunasiz. Boy bo'lsangiz, pulingizni ota-onangizga berib yuboring, och qolasiz, ammo natijasi bo'ladi. Stay foolish, stay hungry.
Imkoniyatlarga ochiq bo'ling. Startap qilayabsiz degani doim o'xshaydi degani emas. Startap uchun eng muhim narsa bu bozor. Bozor bo'lsa, savdo ham bo'ladi. Men muammolarni, noto'g'ri muhitda yechganim ham pand berdi. Buni inobatga olmaganim katta dars bo'ldi. Ammo quvonarlisi imkoniyatlar to'la, hali o'yin tugagani yo'q.
Avallroq Higgsfield AI kompaniyasi ish taklifi bilan chiqqanini yozgandim (o'chirib yuborganman), kecha Alex Mashrabov (CEO @ Higgsfield AI) o'zi yozibdi meeting qilishga. Bunchalik uzoqqa borishini kutmagandim. San Fransisco'da startap qilib foydaga kirgan bir necha asoschilar bilan tanishdim, ulardan mem0.ai, rilla.com, composio.dev, artisan.co, hex.co va boshqalar. Ular bilan qiziq suhbat qildik. Suhbatdan keyin ko'pchiligi jamoaga taklif qilishdi, yechayotgan muammoyimni ular bilan yechishimni aytishdi. O'zimidagi talaygina katta kompaniyalar ham takliflar bilan chiqishdi. Bu juda quvonarli senariy.
Eng yomoni 2 tanlov o'rtasida qoldim:
1. Yo orzularimdan kechib yana kimdir bilan muammo yechish.
2. Yo orzularim bilan vaqtinchalik ochlik, yetishmovchilik ammo qiziq sarguzashtga borish.
Ikkisi ham qiyin. Biri "boy bo'l" desa, ikkinchisi "istaganingga ega bo'l" deydi. Men shularni yanayam ko'proq o'rgandim va tushundim, siz ertaroq tushuning!
2 849
#meme
Dasturchilar:
99% kodimni AI yozayabdi baraka topsin.
Compiler:
Men 100% kodingni yozaman, lekin meni hech eslamaysan, YARAMAS.
2 849
#experience
Hamma vibe coding qilayabdi. Bilasizmi, korxona ko'p maxsulot ishlab chiqarsa nimalar sodir bo'ladi? Ularni test qilish, ko'rikdan o'tkazish qiyinlashadi.
Qayta aytmoqchi bo'lgan so'zim, AI bilan kod yozish ishni tezlashtiradi, sifatni pasaytiradi. Kod yozish oldin ham muammo emas edi. Haqiqiy muammo kodni "review" qilishda edi. Biz hali ham noto'g'ri muammoni yechayabmiz.
"AI bilan kod yozavering, qolganlarni eshitmang" deydigan yomon injenerlikka targ'ib ko'payib qolgan. Haqiqiy injenering o'rganishdan va muammo yechishdan iborat. Muammo yechayabsizmi? Unda nima muammoni qanday yechayabsiz? Shu savolni so'rab ko'ring, agar nimadir o'rganayotgan bo'lsangiz demak to'g'ri yo'ldasiz.
Avvalroq kod yozishni AI ga topshirganim haqida aytgandim. Juda ko'p ishimni yengillashtirdi, ammo juda ko'p muammo keltirib chiqa boshladi ham. Bugundan kamroq vibe coding qilishga o'tayabman. Katta va murakkab ishlar, loyihalar uchun yaramas ekan.
2 849
#experience
Dropbox'da highly distributed systems qurganmiz deb ko'p aytganman. "O'zi tizimlarni nega distribute (tarqatish) qilish kerak?" degan savolga ham javob bermoqchiman.
Ilgariroq agar dasturlar ko'proq foydalanuvchilarga xizmat ko'rsatishi kerak bo'lgan bo'lsa, insoniyat shunchaki serverlarga ko'proq va kuchliroq RAM, Disk va CPU qo'shib kuchaytirgan. Buni Vertical Scaling (chunki moshina eniga emas, bo'yiga o'sadi faqat) deb ataymiz.
Qayisidir nuqataga borib dunyodagi eng kuchli kompyuterni yasab qo'ydik ammo shu ham yetmayabdi degan muammo paydo bo'ladi. CPU cheksiz tezlasha olmaydi, chunki elektr toki bilan gaplashgani uchun juda ko'p qizib ketadi va eriy boshlaydi. Tok o'chib qolsa butun biznesingiz o'chadi degani, chunki bizda faqat bitta kompyuter bor. Serveringiz boshqa regionda bo'lsa RTT (Round Trip Time) va Latency muammolar kelib chiqadi. Xullas siz o'ylagandek ideal emas. Endi bizga lokalizatsiya va tezlik kerak.
Bitta super kompyuter o'rniga 100ta kichik kompyuterlarni tarmoq orqali bog'laymizda, ularni bitta tizim sifatida ishlashga o'rgatish fikri keladi, ya'ni Horizontal Scaling. Ammo bu yerda eng katta muammo bor, untrustworthy network (ishonchsiz tarmoq).
Networking (reklamada aylanay) yaxshi o'qiganlar buni juda yaxshi bilishadi. Tarmoqda nimadir sodir bo'lsa ikkinchi tomon bilmay qolishi yoki tarmoqda yo'qolishlar bo'lishi mumkin (Network Partition Illusion). Yokida "Split-Brain Catastrophe" muammosi yoki The Gray Network ya'ni servis healthy (sog'lom) mi deb so'rasangiz "ha" deyaveradi lekin u juda sekin bo'lgani uchun nechadir foiz trafikni tashlab yuboradi. Boshqa serverlar unga ishlayabdi deb so'rov yuboraveradi va natijada butun region cloud servisi qulashiga olib boradi.
Odatda tizimlarni kengaytirishda (scale), doim ishlab turishini ta'minlashda (Availability) va latency kamaytirish uchun lokalizatsiyalashtirishda distribute qilinadi. Chunki katta traffikga bitta eng kuchli bo'lsa ham qurilma javob bera olmaydi, biri o'chib qolsa ikkinchisi javob berishi uchun va ma'lumot foydalanuvchi regionida saqlansa unga tezroq yetib borishi uchun.
Arxitektura qilishda esa "Stateless", "Stateful" va "Consensus Protocols" degan tomonlari bor. Stateless bo'lsa oson, ma'lumot DBga saqlanadi va load balancer orqali istalgan servis o'sha yagona DB'dan ma'lumot o'qib foydalanuvchiga javob bera oladi. Stateful bo'lsa DB da muammolar paydo bo'ladi. Ma'lumotlarni maxsus key'lar orqali sharding qilasiz, va doim replica olib borasiz. "Split-Brain" muammosini yechish uchun serverlar Raft yoki Paxos algoritmlari orqali ovoz berish yo'lga qo'yishadi. Nega? Chunki tizimlar distributed, ular endi bitta emas ko'p. Va ko'pchilik rozi bo'lganda operatsiya bajarilishi kerak, chunki ma'lumotlar bir joyda emas. Va bu tushunchani "Quorum" deb atashadi.
U yerda yana vaqt muammosi ham bor ayalanay. Butun dunyo bir xil vaqtda operate qila olmaydi. CAP theorem dagi kimni qurbon qilish masalasi ham bor. Xullas juda murakkab jarayon.
Ko'pchilik yozmagan jarayon, menga buni Staff Engineer o'rgatgandi va bu "Formal Verification" deyiladi. Tizimni matematik yo'l bilan to'g'riligini topish mumkin ekan. Test qilishda biz har xil input berib, outputini to'g'ri javob bilan solishtirib olamiz. Lekin distributed systems bunday testlash doim ham ishlayvermaydi.
Formal Verification 3ta bosqichdan iborat. Specification bosqichida tizim nima qilishi kerakligini ifodalaysiz. Implementation qismida kodini yozasiz. Engine qismida implementatsiya qilgan kodiz spesifikatsiya qismida tasvirlagandek ishlashini tekshirasiz. Bu jarayon haqida juda kam bilimga egaman, shunga ko'p yoza olmayman.
Hozircha shular
2 849
Topshirishingiz mumkin, javobolarni formada to'ldirgan email'ingiz orqali olasiz. Video yozib olinadi.
📍 Format: Online
🔗 Havola: https://forms.gle/6K43jHhvw5Zes66s7
