Mutt Technologies
رفتن به کانال در Telegram
돈 이야기 안해요 (아마도) English speakers might want https://x.com/haxxton1
نمایش بیشتر1 335
مشترکین
+124 ساعت
+37 روز
+130 روز
آرشیو پست ها
1 337
잊고있었던 고전 쥐어짜기 수법 REAP (안쓰이는 Expert 몇개 죽이기) 을 쓰면 39GB 메모리만 쓰고 서빙 가능하다 하네요 이거 잘되면 맥 안바꿀게요
추론시 전문가 512개중에 11개만 사용하는 ultra sparse 모델이었는데, 여기서 224개 죽이고 288개만 남 겨도 쓸만하다(고 모델 개발자가 주장중)
주말간 실사용 해볼게요
https://huggingface.co/sh0wie/Qwen3.8-Flash-Next-REAP-288-MLX-4bit
1 337
예고된대로 Qwen3.8-Flash-Next 공개
파라미터 크기는 125B A6B 로 DeepSeek V4 Flash 의 절반에 조금 못미치는데, Gemma 3과 비슷하게 N-gram Embedding이 51B 로 따로 있음. 이건 GPU에 안올리고 따로 읽는용도로 분리한듯 (이거 구현 어떻게 하냐...)
근데 벤치상으로는 DSV4F 를 대부분 이기는 수준
제가 들고있는 맥이 M4 Max 64GB인데 진짜 잘 쥐어짜서 돌리면 될거같은데 모델 낙수효과 드가자
1 337
근데 지금보니까 리스하면 월 257불인데 이거면 클로드 맥스 20x랑 같은거 아님?
클로드 맥스 365/24 무제한으로 쓰는데 페이블보다 살짝멍청하고 절대 데이터 유출 안되면?
1 337
화제의 모델 Qwen3.8 27B가 xhigh 에서 띵킹이 매우 매우 매우 길어서 벤치맥싱이 아니냐는 이야기가 많았는데, medium/low 벤치마크도 결과가 나옴 (artificialanalysis.ai)
결과는 GPT-5.5 low 와 동급
진짜 미친 모델이 나와버림 이거 맥북에서 돌아간다고요
1 337
Crates.io(Rust 패키지 레지스트리)는 NPM 보다 안전하다고 생각하셨나요? 짜잔! arrayref 0.3.10 이 트로이목마를 포함한 채로 배포되었는데, 의존하는 패키지들 중에 굵직한게 많습니다. (spl-token 등)
한국시간 오후 4시 이후애 cargo update 등을 시행하신 적이 있으면 시스템을 면밀히 점검하시기 바랍니다. 저도 해야함.....ㅅㅂ
(참고로 문제의 패키지는 현재는 내려간 상태)
https://github.com/rustsec/advisory-db/issues/3161
1 337
스트라이프가 OpenRouter를 $75B에 인수
놀라운 사실은 OpenRouter 코파운더는 OpenSea 파운더이기도 함. 인생 몇회차일까
https://openrouter.ai/blog/announcements/openrouter-is-joining-stripe/
1 337
윤년(閏年)은 역법을 실제 태양년에 맞추기 위해 여분의 하루 또는 월(月)을 끼우는 해이다. 그레고리력의 정확한 윤년 규칙은 다음과 같다.
서력 기원 연수가 4로 나누어 떨어지는 해는 윤년으로 한다.
서력 기원 연수가 100으로 나누어 떨어지는 해는 평년으로 한다.
서력 기원 연수가 400으로 나누어 떨어지는 해는 윤년으로 둔다.
???: 그딴거 모르겠고 이렇게 하면 됨 (0 ≤ y ≤ 102499)
bool is_leap_year_fast(uint32_t y) {
return ((y * 1073750999) & 3221352463) <= 126976;
}1 337
오랜만에 코인 이야기: 솔라나 블록타임은 이제 400ms 가 아니라 350ms입니다. 단계적으로 200ms까지 줄인다 함
https://github.com/solana-foundation/solana-improvement-documents/blob/main/proposals/0525-reduce-slot-times.md
1 337
AI 찍먹해보면서 느끼는 단상(뇌피셜임, 전공자 아님)
• 프론티어 모델들에서는 사실상 사전학습에 넣을 만한 데이터는 다 들어갔음. 보편적인 문법이나 단순 지식에 대해서는 아무도 불만을 제기하지 않음(오히려 x약같은 엄한 지식 못꺼내게 막는중)
• 모델 체급(파라미터 수)이 높으면 지능이 대부분 높지만(ex: Fable) 체급이 낮아도 사후학습(SFT, RLHF 등) 특히 상위모델 증류로 꽤 많이 따라갈 수 있음. 특히 요즘 초거대 모델들은 아직 undertrain 되어서 사후학습으로 마이너버전 올릴때마다 지능이 확확 올라가는게 체감됨(DSv4, Qwen3.8 27B)
• 사람말을 따라하는 앵무새가 아니라 진짜로 의미있는 일을 하는 인공지능이 되려면 지정된 작업을 적당히 긴 시간동안(=여러 스텝에 걸쳐서) 수행하는 능력이 필요했는데 Qwen3.8 27B 정도면 아주 훌륭하게 이걸 해내고 있음. 단순지식은 프론티어보다 비교적 떨어질지라도(당연한게 얘 양자화하면 13.5GB임) 사후학습으로 이런식의 일머리를 집어넣는건 충분히 가능하다는걸 보여줌
• 프론티어 LLM들의 지능수준은 이제 슬슬 일반적인 사용자들이 원하는 수준을 쉽게 달성할 수 있는 정도에 도달함(GPT-5.6 Luna 정도면 진짜 하루종일 fast 모드로 써도 월 10만원 구독제로 가능. 인간이랑 컴퓨터 주고 어느 사무작업이든 배틀시키면 무조건 인간이 짐). 요즘 관심사는 이렇게 적절한 수준의 모델을 엄청나게 저렴하게 제공하거나(DeepSeek이 매우 선방하는 중), 아예 전략무기 수준의 초지능을 만들어서 달려나가는(OpenAI의 Astra, Anthropic의 Mythos 2 Preview) 두가지로 분화되는 듯(물론 DeepSeek도 초지능 만들고 싶을거임...)
• 곁다리로, Bonsai 가 Qwen3.6 27B를 1-bit 수준으로 양자화해서 저번달에 배포했는데 로컬 인퍼런스에 사족을 못 쓰는 애플이 관심을 보였던 적이 있음. 3.8 27B는 얼마나 잘될까 궁금(Qwen3.6 27B 가 유달리 양자화에 강했는데 이게 undertrain 의 증거라고 보는 의견도 있었기 때문에 마냥 낙관적으로는 생각하지 않음)
1 337
Repost from 무온적 사고 - AI, 명상, 밈
격세지감 느껴지는 o1 pro 가격
2024년 말 당시 o1 뉴스가 처음 나왔을때의 충격을 기억하시는 분이 있을지 모르겠는데, 최초로 인간 지성을 넘는 벤치마크 (ARC AGI)가 나왔고, 수학문제를 풀기시작하며, 논리적인 사고를 하는 모델이었다리움
저도 그때 처음으로 지수적 가속에 관심을 가지기 시작했고요
그때는 어이없이 비싸가지고 코딩에이전트는 커녕 말거는 비싸서 못하는 전시용 모델이었는데
지금은 반의 반의 반의 반의 반의 반값으로 쟤랑 비교도 안될만큼 똑똑한 모델 (5.6 sol)을 쓰고 있는....
데 왤케 세상은 바뀐게 없는거같죠? 😭
1 337
스피릿 항공이라는 미국 저가항공사가 올해 봄에 파산해서 떠들썩했는데요(왕편을 타고 왔는데 복편 타기 전에 항공사가 사라졌어요 등등 레전드 사건), 구글이 경매에 참가해서 낙찰받았다고 합니다. 경매항목은 이메일, 캘린더, 문서, 스프레드시트, 채팅 내역 등등...
당연히 이유는 AI에 먹일 데이터 확보. 학습 전에 익명화는 진행한다고 하네요 흠...
https://www.axios.com/2026/08/17/google-spirit-airlines-bankruptcy
1 337
저가 클라우드로 유명한 Hetzner가 실험적으로 무료 배포했던 자체 DSv4, GLM-5.2, Kimi API 일주일만에 싸그리 제거완료
최적화 안하고 vLLM 그냥 돌려서 서빙하려니 돈 살살 녹제
https://x.com/Hetzner_Online/status/2087099126760501364
https://x.com/miaugladiator1/status/2089305196975305053
1 337
서강대 재학생 및 졸업생 개인정보가 대규모로 유출되어서 난리인데... 52년생 70학번 박*혜 씨도 피해자 명단에 올라가 있네요 진짜 디비 싹 털어가긴 한듯
하 씨 누구지... 진짜 모르겠네
https://x.com/whysolonely1024/status/2088479159991541782
