en
Feedback
Hacker News 100 繁體中文

Hacker News 100 繁體中文

Open in Telegram

Hacker News (https://news.ycombinator.com) 上分數 > 💯 及討論 > 🔟 的分享內容 本頻道使用 AI 大型語言模型(LLM)自動化摘要,雖已盡可能讓內容呈現為符合台灣正體中文的描述方式以及格式,但受限於目前的 AI 的不確定性、不可控等因素,仍有許多不完美、待改進之處,敬請見諒。 也歡迎參考手足頻道: 🏆 https://t.me/hn_best_cht 🔥 https://t.me/HackerNewsActiveZhTW

Show more
Buy Ad
1 119
Subscribers
No data24 hours
+37 days
+1730 days
Posts Archive
陶哲軒:開放數學問題正如不可再生資源般遭 AI 開採 (★ 105 分)
陶哲軒指出,數學問題的數量雖然無限,但真正值得投入的開放問題並非取之不盡。好的問題通常能揭示新觀念、串連不同領域,且難度剛好位於既有方法可望突破、但仍須發明新方法的邊界;例如計算圓周率某個極遙遠位數,形式上可提問,卻通常不會帶來任何新理解。他將此比喻為被海洋包圍卻缺乏飲用水:問題很多,不代表有研究價值且可帶來成果的問題很多。 判斷問題是否有價值,需要研究者長期累積對領域「難度地形」的理解,也就是哪些題目可直接解出、哪些須費力突破、哪些在現有方法下不可及。有些原本無趣的問題,也可能因為與其他理論出現意外關聯而變得重要。新的技術、計算能力與文獻存取條件,會降低許多問題的難度;過去這類工具往往也能擴大可探索的前沿,但 AI(人工智慧)時代的困難在於,工具快速改變,外界卻難以辨識哪些題目對 AI 容易、哪些仍困難,因為業者很少揭露失敗成果及求解過程。 他憂慮,AI 大規模快速抽取答案,可能把研究者尚在醞釀的問題迅速「壓平」,使辨認有前景問題成為更稀缺的資源。一旦只要傳出有人正研究某題,就可能引來大量 AI 算力搶先求解,研究者便有誘因不再公開研究方向,危及開放科學長久以來仰賴的協作文化。陶哲軒認為,數學界不應只看是否得到答案,還應重視解題過程帶來的洞見,以及它對鄰近問題難度的啟發;某些問題應被視為需要細緻分析的研究對象,而非只收集一份可形式驗證卻欠缺理解的答案。 Hacker News 討論中,不少人認同核心問題不在於數學會被「解完」,而在於有共識、能引導後續研究且適合人類理解的問題,需要數十年甚至數百年的共同篩選與培養。一些留言以近日 AI 介入納維-斯托克斯方程相關成果為背景,擔心大型實驗室為了宣傳與搶先得獎而投入龐大算力,卻未必提供可消化的證明脈絡。也有人將此比作挖掘化石:重點不是挖出最多化石,而是用化石回答關於生命演化的問題。若學界只剩檢查 AI 產出的形式化證明,例如由 Lean(形式化證明檢查器)驗過的大型程式,年輕研究者的訓練、學術評價與投入意願都可能受損。 另一派則認為,已有答案不會阻止人類繼續研究;數學家仍可反向分析 AI 證明、尋找更簡潔優美的論證,正如棋手可從棋力引擎的招法學習。有評論主張,真正需要調整的是學術獎勵機制,從「誰先解出題目」轉向獎勵解釋、重現、整理與提出新問題;也有人相信 AI 未來同樣能提出下一個如黎曼猜想般深刻、但對當代 AI 仍困難的問題。爭論的焦點因此不是是否應採用 AI,而是人類能否保有理解、判斷價值與共同設定研究方向的能力。
👥 75 則討論、評論 💬 https://news.ycombinator.com/item?id=49616968

如何打造一台印表機 (★ 111 分)
作者將 Xteink X3 電子紙閱讀器改造成可被電腦辨識的無線印表機,起因是原本必須連上裝置熱點、開啟網頁才能上傳內容,操作相當繁瑣。他以 IPP(Internet Printing Protocol,網際網路列印協定)實作印表機通訊,讓 macOS 可經由 HTTP(Hypertext Transfer Protocol,超文字傳輸協定)查詢裝置能力並送出列印工作。這台名為 penguin 的裝置宣告可處理黑白、300 dpi(每英吋點數)、單面與單份列印,接收 Apple Raster 與 PWG Raster(Printer Working Group 制定的點陣列印格式),由 Mac 先將文件轉為像素資料後再傳送。 為了讓 Mac 能自動找到這台「印表機」,作者利用 Bonjour(Apple 裝置探索機制)發布 IPP 服務,並額外加入 macOS 無驅動探索所需的 `_universal` 子類型;由於 Arduino 的封裝介面未提供這項功能,他直接呼叫 ESP-IDF 的 mDNS(多點傳送網域名稱服務)API。真正的難題在於記憶體:一張 300 dpi 的 Letter 紙張影像約為 2,550 × 3,300 像素,未壓縮灰階資料約 8.4 MB,但採用 ESP32-C3 微控制器的 X3 僅有 400 KB 的 RAM(隨機存取記憶體),還得同時維持 Wi-Fi 與印表機服務。 作者沒有在記憶體中暫存整頁影像,而是把電子紙螢幕既有的畫面緩衝區當成工作區:資料抵達後逐列解碼、縮放,再以抖動(dithering,以黑白圖樣模擬灰階)轉換,隨即寫入螢幕對應位置並重複使用暫存空間。這使影像緩衝所需 RAM 從約 113 KB 降至 62 KB,替網路 socket 緩衝保留空間。最初畫面會像紙張送出般分段更新,但每次更新約需半秒,因此後來改為整頁完成後一次顯示;列印成果也會以 BMP 點陣圖存入 SD 記憶卡,並能在閱讀器的資料夾中瀏覽,形成數位版的「出紙匣」。 實測時,作者在 macOS 的 Preview 選擇 penguin 後列印漫畫圖片,約一秒便顯示在 X3 上,效果令他滿意。Hacker News 討論普遍稱讚這是符合電子紙直覺用途的設計,還有人聯想到《星際爭霸戰》的 PADD(Personal Access Display Device,個人存取顯示器)。也有人詢問為何不直接傳送 PDF(Portable Document Format,可攜式文件格式);作者回應,僅有 400 KB RAM 的裝置難以承擔 PDF 轉譯所需的記憶體、處理效能與程式空間。另有讀者討論 Xteink 型號選擇:X3 缺少 USB-C 與背光,但續航約可達七天;偏好背光者則推薦 X4 Pro。
👥 23 則討論、評論 💬 https://news.ycombinator.com/item?id=49617255

美國警方憂心 Meta 智慧眼鏡可能遭用於偷拍警察 (★ 100 分)
美國多地執法機關憂心,配備相機與麥克風的 Meta Ray-Ban 智慧眼鏡,可能被帶入警局、拘留所或監獄,暗中錄下牢房格局、監視器位置、員警巡邏模式等敏感畫面。紐約市警察局(NYPD)反恐單位今年 1 月已發出備忘錄,要求徹底檢查可讓被拘留者配戴的眼鏡;起因是有人曾以智慧眼鏡拍攝南卡羅來納州拘留中心內部,包括淋浴間、牢房與擁擠餐廳,其他被拘留者似乎未察覺自己遭錄影。 取得的 12 份文件顯示,從緬因州到加州的警政與聯邦單位,也擔憂眼鏡可用於恐攻前的場勘與情報蒐集。美國聯邦調查局(FBI)指出,2025 年元旦紐奧良汽車衝撞攻擊案犯嫌,曾戴著智慧眼鏡騎車巡視波本街;執法機關因而要求員警留意可疑配戴者。緬因州的融合中心則警告,結合人工智慧(AI)的眼鏡可能具備臉部辨識功能,用來肉搜員警身分或人際關係。美國移民及海關執法局(ICE)也已禁止員工在聯邦辦公場所配戴此類裝置,理由是可能意外擷取或傳送敏感資訊。 Meta 回應稱,眼鏡錄影時會亮起且無法關閉的白色 LED 指示燈,若有人遮擋或破壞燈號,相機就會停用。但報導引述隱私倡議人士批評,執法機關長期以攝影機監看民眾,當民眾能反過來記錄警察時,卻將其稱為安全威脅,反映監控權力的不對等。報導也指出,外界對這類眼鏡的疑慮不限於警方:未經同意錄下陌生人,已可能成為騷擾、跟蹤與侵犯隱私的工具。 Hacker News 討論多聚焦於「反向監控」(sousveillance,民眾記錄掌權者以制衡監督)的諷刺性。許多人認為,警方若在公共場所依法執勤,就不該害怕被錄影;攝影機既能揭露濫權,也能澄清對員警的不實指控。不過也有人強調,爭點不只是街頭拍警察,而是未經許可錄製監獄、拘留設施等管制場所;這可能洩露逃脫漏洞、危及人員安全,也牽涉被拘留者的隱私。反方則認為,拘禁設施長期缺乏外部監督,隨機錄影有時正能揭露虐待與不人道處遇。 討論也延伸到警用隨身攝影機的效果。部分留言認為,多數員警在實際使用後會肯定它能保護自己、加快申訴調查並抑制不當行為;質疑者則指出,警察工會過去常反對強制配戴,而影像是否公開、何時關閉或靜音,仍可能由機關掌控。另有不少人懷疑此報導意外替 Meta 塑造「對抗權力的工具」形象,認為公司或許樂見焦點從「偷拍眼鏡」轉向「監督警方的裝置」。
👥 80 則討論、評論 💬 https://news.ycombinator.com/item?id=49611946

Mercury 2.5 (★ 108 分)
Inception Labs 發表 Mercury 2.5,這是一款擴散式語言模型(dLLM, diffusion language model),主打比前代 Mercury 2 高出 40% 的能力,同時維持低延遲與低費用。公司宣稱,它可在常見的 NVIDIA GPU 上達到每秒 1,107 個 token(模型處理文字的基本單位),脈絡長度達 26 萬 token;定價為每百萬輸入 token 0.20 美元、輸出 token 0.75 美元,上市期間另提供八折優惠。Mercury 2.5 也提供可調式推論、平行工具呼叫,以及符合結構描述的 JSON(資料交換用的結構化文字格式)輸出。 該公司表示,模型改良來自實際部署後累積的使用者回饋與失敗個案,而不只依據基準測試。Mercury 已被用於搜尋代理與 RAG(先檢索外部資料、再整理答案的流程),可在一次互動內處理查詢改寫、結果重排、資料彙整與答案查核等多次模型呼叫。在語音代理方面,OpenCall 稱其採用 Mercury 後,中位回應延遲已降至約 170 毫秒,P50(中位數延遲)低於 0.2 秒,P99(99% 請求可達到的延遲門檻)則由數分鐘縮短為約 1 秒。 程式開發也是 Mercury 2.5 鎖定的情境。Augment Code 將其用於脈絡壓縮、模型路由與工具搜尋,稱脈絡壓縮時間由約 150 秒降至 27 秒,費用降低九成且品質維持。Inception 同時預告 Mercury Voice 與 Mercury Router:前者針對語音代理,首個 token 產出時間(TTFT, Time to First Token)低於 170 毫秒;後者則分析提示內容,再將工作分派給最符合品質、速度與費用條件的開放或封閉模型。Mercury 2.5 可經由 Inception API、Baseten 與 OpenRouter 取得,企業方案提供專屬算力、自動擴縮、法規控管及可調整的資料保留設定。 Hacker News 的回應普遍肯定擴散式架構在高速、低費用推論上的潛力,認為即使模型並非可在本機自行代管,仍適合商業情境中的即時、可接受品質工作負載。有留言指出,每秒約 1,100 token 的速度尤其適合多模型協作架構中的仲裁模型,可降低額外判斷步驟帶來的延遲。不過,也有實測者認為 Mercury 2.5 雖已可作為通用聊天模型,能力大致可與前一代公開權重模型相比,但一般工具使用與代理式程式開發仍不夠成熟;另有人質疑官方跨模型比較偏重速度,能力提升又主要與 Mercury 2 相比,可能使宣傳顯得選擇性較強。隱私方面,留言者也提醒,API 平台雖允許關閉「改善所有人模型」選項,以避免提交內容被用於訓練,但使用者仍須主動完成設定。
👥 13 則討論、評論 💬 https://news.ycombinator.com/item?id=49616354

92 歲數學家與青少年學徒 (★ 119 分)
瓊・伯曼在哥倫比亞大學退休多年後,原以為重要的數學成果已成過去;2019 年夏天,92 歲的她收到一封來自鄰近社區 15 歲少女瓦蘇達・巴拉特拉姆的電子郵件。少女因高中幾何課與首次接觸數學證明而對更深的數學產生興趣,希望伯曼指點。伯曼過去常收到類似請求,甚至懷疑是教師指定的作業,起初也不想充當照顧孩子的角色,但這封信的真誠讓她改變主意。 伯曼當時剛失去相伴多年的丈夫,準備從郊區住所搬回曼哈頓,特意選擇靠近哥倫比亞大學的公寓,盼望隨時能搭計程車參與數學對談。她仍想持續做數學,因此答應先與少女見面,並指定 I. N. Herstein 的《Topics in Algebra》作為教材;這是研究所程度常見、難度很高的抽象代數入門書。兩人同住河濱大道附近,相距僅十個街區;首次見面時,伯曼覺得剛滿 15 歲、即將升上十年級的巴拉特拉姆仍顯得稚嫩,且由父親陪同前來。 Hacker News 的讀者普遍被這段跨世代師徒關係打動,認為它提醒人們:認真投入的導師與學習者相遇,能帶來比單一學術成果更長遠的價值。有人聯想到印度數學家拉馬努金與其賞識者哈代的故事:一名年輕人憑強烈求知欲,獲得資深數學家的引導,進而開展罕見的學術旅程。也有讀者說,這篇報導在人工智慧 (AI) 介入數學研究的新聞之外,重新凸顯人際傳承、執著與耐心的重要性。 討論中也出現較務實的意見,指出報導著重人物情感與人生經歷,對實際數學研究及師徒如何共同推進問題著墨不多。不過,多數留言仍肯定故事的核心不在於把數學浪漫化,而是呈現一位高齡學者不願離開思考、一名少年主動跨出校園課程框架,以及兩人因共同的數學好奇心而建立連結。
👥 10 則討論、評論 💬 https://news.ycombinator.com/item?id=49591563

展示 HN:LLM 注意力機制視覺化 (★ 101 分)
這個互動式工具將 Transformer 架構大型語言模型(LLM)的注意力機制視覺化:讀者可將游標移到模型產出的任一詞元(token,模型處理文字的基本片段)上,查看先前哪些詞元與該詞元的產出關聯最強。畫面以文字透明度呈現關聯程度,讓人能直觀觀察模型在撰寫下一個詞元時,如何從既有上下文挑選較相關的內容。 作者以搬遷公告摘要為例指出,模型原封不動重述地址與日期時,來源句中的相應資料會明顯浮現。這說明 LLM 並非只能依靠有限的內部狀態猜測整段文字,而是能在每一步存取先前詞元,將注意力集中於需複製的內容,因此即使採機率式預測,仍可相當準確地重現長字串。另一個例子中,模型將「門禁卡仍可使用」及「電話號碼維持不變」兩句的語意結合,產出「remain」一詞,呈現它同時參照多段文字的情況;一個僅有 6 億參數的小型模型,也能幾乎完整重現 JavaScript 函式。 不過,這項視覺化刻意大幅簡化。它將注意力權重乘上值向量(value vector)的大小,再跨越所有注意力頭(attention heads,平行處理不同關聯的子單元)與模型層彙整,最終每個舊詞元只保留一個數值。作者強調,這不能直接證明某詞元對模型決策的真正因果影響,只適合用來觀察有趣的關聯樣式。工具以 React 製作,並以 Transformers.js 在瀏覽器中產出文字;為免讀者等待數百 MB 的模型下載,網站也預先產出多組範例。由於 ONNX(開放神經網路交換格式)模型在 WebAssembly(Wasm,讓瀏覽器執行高效能二進位程式的技術)環境下不易取得中間運算值,作者另行修改模型檔,揭露所需的內部資料。 Hacker News 討論普遍肯定這種呈現方式有助於教學,部分讀者認為它比書籍與影片更容易建立對注意力機制的直覺,也有人特別欣賞它讓跨句語意結合變得可見。但也有技術質疑指出,「值向量幅度較大就代表影響較大」並不嚴謹;將所有層與注意力頭加總,也可能讓早期層的訊號掩蓋後期層。作者認同這些限制,表示未來可能新增篩選特定層的控制項。另有討論修正計算複雜度的說法:KV 快取(key-value cache,保留先前詞元的鍵與值向量)可避免重算舊詞元,但每產出一個新詞元,仍須與所有既有詞元計算注意力,因此單步解碼成本隨上下文長度呈 O(N) 成長,連續產出 N 個詞元時仍約為 O(N²);長上下文即使快取已暖機,仍會增加記憶體讀取與服務費用。
👥 19 則討論、評論 💬 https://news.ycombinator.com/item?id=49613068

FreeBSD 14.5 正式版發布 (★ 100 分)
FreeBSD 14.5-RELEASE 已正式推出,這是 stable/14 分支的第六個正式版本。由於該分支已進入較後期的維護階段,本次更新幾乎不以新功能為重點,而是集中修正錯誤、更新硬體驅動程式,以及升級由外部維護的軟體。系統可用於 amd64(x86-64)、i386(32 位元 x86)、AArch64(64 位元 ARM)、armv7、PowerPC 與 RISC-V 等多種硬體架構。 官方提供多種安裝媒體:`dvd1` 包含基本系統、文件、除錯套件與少量桌面套件;`disc1` 僅含基本系統;`bootonly` 與 `mini-memstick` 則需在開機後經由網路下載安裝內容。使用者也可選擇 USB 安裝映像檔、ARM 裝置用 SD 卡映像檔,或 QCOW2、VHD、VMDK 等虛擬磁碟格式。ARM 映像檔預設設有 `freebsd` 與 `root` 帳號,兩者均有公開預設密碼,完成開機後應立即更改。 FreeBSD 14.5 也已備妥 Amazon EC2(Amazon 雲端虛擬主機服務)、Google Compute Engine 與 Microsoft Azure 等雲端平台映像檔,並提供 OCI(Open Container Initiative,開放容器標準)容器映像檔。14.5 維護版的支援期限至 2027 年 6 月 30 日;14.4 的生命週期終止日為 2026 年 12 月 31 日;整個 FreeBSD 14 系列則預計維護至 2028 年 11 月 30 日。 Hacker News 討論首先指出,FreeBSD 15.1-RELEASE 已先行發表,因此 14.5 的主要意義在於延續 14 系列,而非代表最新主線。社群特別提到,14.x 是最後仍提供 i386 安裝映像檔的系列;若仍須維護 32 位元 x86 設備,14.5 是關鍵選項,若要在新硬體安裝並爭取更長的未來版本生命週期,則多半會考慮 15.x。 討論中也針對正式版、STABLE 與 CURRENT 分支的生產環境用法出現歧見。部分留言主張正式版適合正式環境,搭配 `freebsd-update` 套用安全修補即可;也有人誤將 STABLE 比作長期支援版本。不過有留言依官方說明更正:STABLE 本質上仍是下一個主要版本的開發分支,可能含有尚未正式發表的程式碼,不宜直接視為保守的長期維護版本。另一方面,也有實務案例指出,pfSense CE 與 Netflix 的部分 CDN(內容傳遞網路)設備確實採用 CURRENT,顯示分支選擇仍取決於組織的測試能力、硬體需求與維運風險承受度。
👥 18 則討論、評論 💬 https://news.ycombinator.com/item?id=49609174

Trey Parker 與 Matt Stone 將《南方四賤客》更名為《南美洲》 (★ 103 分)
《南方四賤客》在贏得艾美獎最佳動畫節目後,以戲謔口吻宣布將名稱改為「South America」。創作者 Trey Parker 與 Matt Stone 表示,此舉靈感來自 Apple 與 Google 的「勇氣與愛國精神」,並把母公司 Paramount Skydance 稱作「Skydance Capitulation」;其中 Capitulation 意為屈服,刻意把企業名稱中的 Corporation 替換掉,帶有嘲諷意味。第 29 季將於 9 月 16 日晚間 10 點在 Comedy Central 首播,並於 Paramount+ 在全球上架,美國、加拿大與澳洲則於隔日可看新集數。 這項改名顯然延續該劇一貫以荒謬手法嘲弄政治與企業的作風。貼文將「South Park」改成「South America」,既是地名文字遊戲,也被解讀為影射近期把既有地名政治化的風潮;有留言特別聯想到將 Lake Ontario 更名為 Lake of America 的爭議。對 Paramount Skydance 的雙關,也讓公告不只是新季宣傳,而是把企業併購、政治姿態與命名權力一併納入笑料。 Hacker News 的討論焦點隨即轉向《南方四賤客》的政治立場與諷刺效果。部分觀眾認為,該劇早年慣用「兩邊都很爛」的姿態,可能淡化了政治威權與民粹主義的危險;批評者認為,這種犬儒論調替 MAGA(Make America Great Again,讓美國再次偉大)式政治提供了有利土壤。也有人指出,該劇曾以「ManBearPig」嘲弄氣候變遷,後來又以劇情修正立場,正反映其創作者並非從不改變。 另一派觀眾則認為,近十多年來該劇對右派極端勢力的批判已十分明確,例如以 Mr. Garrison 影射川普,並諷刺 ICE(美國移民及海關執法局)、Peter Thiel、加密貨幣投機與川普式利益交換。支持者認為,作品長期嘲弄的對象包括宗教團體、迪士尼、中國、政治正確文化與各種權力菁英,不能簡化成替任一陣營服務;但批評者提醒,諷刺常會被受眾照字面挪用,當現實政治本身已高度荒謬時,單靠嘲笑未必能帶來清楚的批判效果。
👥 41 則討論、評論 💬 https://news.ycombinator.com/item?id=49616239

OpenAI 為搶解一項足以成就職涯的數學難題,使出不正當手段 (★ 132 分)
紐約大學數學教授 Tristan Buckmaster 與 Anthropic 數學家 Levent Alpöge 宣布,運用 OpenAI 的 Codex 與 Anthropic 的 Claude 等人工智慧(AI)模型,針對納維-斯托克斯方程式(Navier-Stokes equations,描述流體運動的基礎方程式)相關難題提出三項證明與初步成果。爭議核心是「納維-斯托克斯方程式的存在性與光滑性」:它是克雷數學研究所列出的七項千禧年大獎難題之一,首個有效解答者可獲 100 萬美元獎金。這個問題關乎流體是否會在特定條件下產生數學上的奇異點,對理論物理與流體力學意義重大。 Buckmaster 指稱,當他與 Alpöge 即將完成研究時,得知兩人的進度已流入 OpenAI;OpenAI 隨後表示已取得該問題的完整證明。他認為,自己與 Alpöge 選擇的「平滑外力」路徑相當冷門,不太可能只靠幾天內把題目交給模型便自然找到,因此懷疑 OpenAI 在得知其研究方向後,動用龐大運算資源搶先完成成果。OpenAI 數學研究負責人 Sébastien Bubeck 否認指控,稱其說法不實且具煽動性,並表示團隊遵守學術規範。 另一項焦點是研究署名與資料使用。Alpöge 雖任職於 Anthropic,但此次研究並非代表公司進行;兩人反而主要使用 OpenAI 的 Codex。Buckmaster 指稱,OpenAI 曾提議將 Alpöge 排除於共同署名之外,Bubeck 也在他打算公開爭議時說出「何必毀掉自己的職涯」及「若你不要我客氣,我也不必客氣」等話。Buckmaster 另憂心,若自己未退出 Codex 對話用於模型訓練的機制,OpenAI 模型可能已從其互動紀錄吸收研究內容,並在相近提問下重現其思路;OpenAI 未回應這項可能性。 Hacker News 的多數意見認為,OpenAI 即使沒有直接挪用成果,在得知其他研究者接近突破後,以大量運算資源搶先發表,也違反學術研究重視互信與合作的慣例。部分留言則引述 OpenAI 的說法:團隊原以為 Anthropic 已經解出問題,只是想測試自家模型能否重現成果,後來才發現尚無人完成;若兩方證明的方法與結果確有顯著差異,便不能直接認定是抄襲。討論者普遍認為,最關鍵仍是比對兩份證明的技術內容、時間線與模型訓練資料來源;無論爭議最終如何判定,事件已凸顯 AI 輔助數學研究在署名、資料權利、研究倫理與商業競逐之間的緊張關係。
👥 27 則討論、評論 💬 https://news.ycombinator.com/item?id=49615926

四顆 SSD 串流,MacBook Pro 上以每秒 1 個詞元執行 Kimi K3(2.8 兆參數) (★ 139 分)
Deltafin 是以 Rust 撰寫的本機推論工具,目標是在 Apple Silicon 電腦上執行 Moonshot AI 的 Kimi K3;這是一個擁有 2.8 兆參數的混合專家模型(MoE,Mixture of Experts),完整權重規模極大,原本預期需約 16 個節點、4.8 TB 視訊記憶體等級的基礎設施。此分支將約 1.45 TB 的專家權重分散存放於四顆 SSD(固態硬碟),按需讀取,而非將整個模型載入 128 GB 記憶體。作者強調每個詞元(token,模型處理文字的基本單位)仍由完整 K3 驗證,不刪減專家權重,也不以較小模型取代最終判斷。 在配備 M5 Max、128 GB 記憶體與四顆 SSD 的 MacBook Pro 上,作者量得 512 個詞元的穩定輸出速率為每秒 0.92 個詞元;啟用草稿模型(draft model,先猜測後由大型模型驗證的加速方式)後可達每秒 1.00 個詞元,128 個詞元測試最高為每秒 1.13 個。四顆硬碟的讀取量能具明顯效益:單碟約為四碟速率的五成多,兩碟約七成,三碟約九成。不過輸入階段的 prefill(預填,先處理提示文字與上下文)仍是瓶頸:512 詞元提示文字約要等待 375 秒才出現第一個詞元,原因是現行作法會重複讀取專家權重,累積讀取量遠超過模型本身大小。 Deltafin 並非宣稱權重完全位元一致。專家部分保留原始 MXFP4 精度,但常駐的注意力主幹採用 int8 整數量化,與原始 BF16(16 位元腦浮點格式)權重不完全相同;作者主張的是在指定測試提示下,輸出可與自己的參考版本維持相同詞元序列。專案也提供 OpenAI API 相容伺服器,可供本機聊天或文字接續使用;另可選裝 DSpark 與 Qwen 等較小模型來預測後續文字,再交由 K3 檢查,以縮短純文字接續的耗時。作者認為這類實驗的價值,不只在於速度,更在於找出消費級設備執行超大型模型時的儲存、排程與讀取瓶頸。 Hacker News 討論對技術成果抱持兩極看法。支持者認為,即使每秒僅約一個詞元,能在筆電上完整執行 2.8 兆參數模型本身已相當罕見,尤其適合夜間批次作業、內部文件審閱或不願將資料送往雲端的工作;慢速工作仍可平行部署多台設備。批評者則指出,六分鐘的首詞元等待時間使互動式聊天幾乎不可行,且多顆外接 SSD、Thunderbolt 5 外接盒與高階 MacBook Pro 的成本不低。作者回應,現階段最急需改善的是依專家重新安排 prefill 工作,理想上讓每層每個專家只讀取一次,將讀取放大效應從約 6.2 倍降至接近 1 倍。 討論也肯定作者公開失敗測試的做法:儀器發現讀取執行緒上限、需求與預取佇列共用限制、鏡像硬碟負載失衡,以及過時草稿深度測試等問題,修正後分別帶來約 8% 至 14% 的改善;相對地,增加 RAM 專家快取、單一副本條帶化或讓兩顆硬碟共用同一條 Thunderbolt 連線,反而降低效能。另一方面,也有人批評 README 文字冗長、格式難讀,且帶有明顯由大型語言模型撰寫的痕跡。整體而言,社群多將此專案視為尚不適合即時對話、但對本機大型模型推論與 SSD 串流技術具探索價值的工程實驗。
👥 52 則討論、評論 💬 https://news.ycombinator.com/item?id=49616257

英國機場因空中交通管制故障取消數百架航班 (★ 100 分)
英國多座機場因空中交通管制(ATC, Air Traffic Control)技術故障出現大規模延誤與取消。負責航管的英國國家空中交通服務機構 Nats 表示,問題出在「航班處理系統」,工程人員已在現場搶修,但全面恢復仍需時間。航班追蹤網站 Flightradar24 指出,當日下午約有 200 架次航班取消,數字預期還會增加。 倫敦希斯洛、蓋特威克、東密德蘭與曼徹斯特等機場均受波及;希斯洛的出發航班一度暫停,恢復後仍反覆受阻,但抵達航班暫時可照常降落。英國交通大臣 Heidi Alexander 表示,技術人員已找出問題並正進行修復,建議旅客向航空公司確認航班狀態。英國航空、易捷航空(easyJet)與瑞安航空(Ryanair)等業者均承認服務受影響;易捷稱部分航班無法執飛,並表示將提供免費改搭或退款,必要時安排餐食與住宿。 Hacker News 討論最常提及 Nats 在 2023 年 8 月也曾因航班資料識別碼衝突而故障,當時約 2,000 架次航班取消,混亂延續數日。這次事件再度引發對關鍵航管軟體韌性、老舊技術債與維護資源是否充足的疑慮。不過,留言中關於外包、地緣政治破壞等猜測都沒有提出可驗證證據,較多意見認為,在釐清故障根源前不宜過早歸咎特定原因。 不少受影響旅客最不滿的並非單純延誤,而是航空公司未能即時交代飛機位置、替代機材、機組人員與後續時程。有人認為航空公司在不確定能否追回時刻表進度前,會延後公布壞消息;也有人指出,航班取消後牽涉轉機旅客、機組調度與原本已高載客率的後續班機,確實難以迅速提出可靠方案。討論建議旅客保留延誤與支出紀錄,並查閱 UK261/EU261(英國/歐盟航空旅客權益規範):航管故障通常可能被視為航空公司無法控制的特殊情況,未必適用定額賠償,但航空公司仍可能負有改訂航班、餐飲、住宿或合理費用償付等照顧責任。
👥 63 則討論、評論 💬 https://news.ycombinator.com/item?id=49614557

Muse:Meta 個人 AI 代理人的功能與能力 (★ 108 分)
Meta 推出 Muse,定位為能代為完成工作的個人 AI 代理人。它採用代理型 AI(agentic AI,能自行規劃並完成多步驟工作的人工智慧),可回答問題、瀏覽網頁、預約服務、填寫表單、處理客服事項、寄送電子郵件、購物、建立文件與產生圖片;也能串接電子郵件、行事曆、Instagram 等日常應用程式,追蹤目標、監看天氣或價格等事項,並在應用程式關閉後持續處理任務。使用者可在 Muse 應用程式或 WhatsApp 中以對話方式下達指令,免費方案設有使用額度上限,超額後可等待額度重新計算或訂閱付費方案。 Muse 的核心是名為 Muse Secure VM 的專屬虛擬機器(VM),讓代理人在獨立瀏覽器環境中代為操作網站。Meta 表示,寄信、付款、分享資料等關鍵動作都必須先由使用者審閱與核准,並可查看完整活動稽核紀錄。登入憑證存放於代理人無法讀取的安全憑證庫,未來將串接 1Password;購物結帳時則產生一次性卡號,避免商家與代理人接觸真實卡號。官方也宣稱對話不會提供給 Meta 的廣告系統,且符合資格的消費可獲 Link 購物保障。 Hacker News 的主要質疑集中在隱私與信任。多數留言認為,若要讓代理人有效處理生活事務,就必須交出電子郵件、行事曆、購物習慣、聯絡網絡及其他個人可識別資料(PII);即使有核准流程與隔離環境,資料仍由長期以廣告追蹤及蒐集聞名的 Meta 掌握,因此難以放心。也有人指出,WhatsApp 的端對端加密不代表所有後設資料都不會被掌握;代理人若接觸更多帳號與服務,可能進一步擴大可被分析的個人行為輪廓。展示內容頻繁出現訂票、比價與購買情境,也讓留言者懷疑產品的真正目標是推動更多消費與更精準的廣告投放。 另一派則認為,Muse 的價值不在技術首創,而在於把 OpenClaw(可自行架設的 AI 代理工具)類型服務包裝成一般人可直接使用的成熟產品。對不熟悉技術、又希望減少規劃與行政瑣事的人而言,能自動比較價格、整理選項、安排提醒及處理例行工作,確實有吸引力;Meta 龐大的 Facebook、Instagram 與 WhatsApp 使用者基礎,也可能帶來快速普及優勢。不過,討論者也提到 Google、xAI 與其他新創已有相近服務,自行架設的私有代理人亦是替代方案;加上 AI 模型仍可能在訂位、改班機或付款等高風險任務中出錯,Muse 能否跨越信任障礙,將比功能完整度更關鍵。
👥 91 則討論、評論 💬 https://news.ycombinator.com/item?id=49615537

裝有放射性槳葉的直升機 (★ 100 分)
CH-53 Sea Stallion 重型直升機自 1966 年服役,主旋翼槳葉必須承受極大載重;一旦作為結構主樑的鋁或鈦製翼樑出現細微裂縫,可能迅速演變為槳葉斷裂。早期設計將槳葉密封並充填氮氣,地勤可藉由槳葉上的壓力指示器判斷是否漏氣,但飛行途中仍需要讓駕駛立刻得知異常。 為此,CH-53 採用 IBIS(飛行中槳葉檢查/監測裝置)。槳葉內壓正常時,氣壓會讓彈簧機構維持遮蔽位置;若翼樑裂縫導致氮氣外洩,遮蔽物便移開,露出少量鍶-90(Strontium-90)的 β 射線來源。機身內的蓋革計數器(Geiger counter)偵測到輻射後,即可警告駕駛。這套設計不必在高速旋轉的槳葉上裝電池、電子零件或複雜配線,避開滑環接點的可靠度難題。新款 CH-53 已改用光纖偵測複合材料槳葉故障,舊型機則仍沿用這種機械與放射性結合的方案。 Hacker News 討論補足了原文較簡略的機械原理,並引述 MH-53E 維修人員說法:每片槳葉根部都有一具 BIM(Blade Inspection Monitor,槳葉檢查監測器),IBIS 主機則裝在主旋翼後方機體上。公開管制文件顯示,每個裝置約含 500 微居里、即 18.5 MBq(百萬貝克勒爾)的鍶-90,封裝於約原子筆按鈕大小的不鏽鋼圓筒。正常遮蔽狀態下,距離 3 英吋的外部劑量約為每小時 0.8 毫倫琴;故障時射源伸出,距離 12 英吋約為每小時 75 毫倫琴。 輻射風險是討論焦點。多數意見認為,鍶-90 的危害主要在於吞食或吸入後造成內部曝露;正常狀態下射源有遮蔽,β 射線穿透距離也短,且裝置位於離乘員較遠的槳葉上,因此日常飛行的風險有限。不過,鍶-90 也是核子落塵的重要污染物,並不能籠統稱為無害;墜機殘骸與報廢處置仍須嚴格管制。另有人指出,美國海軍已向 NRC(美國核能管制委員會)登錄射源並訂有處理程序,但老舊機隊的維護與除役管理仍值得留意。 對於這是否是過度複雜的設計,討論整體評價偏正面:它以可靠的密封氣壓、彈簧與天然持續放射的射源,取代旋翼樞紐內難以維護的電氣連接,堪稱在當時技術條件下相當巧妙且耐用的工程折衷。有人推測不用無線偵測器可能涉及作戰保密,但也有人反駁民用 Sikorsky 直升機同樣採用此類機制,顯示核心考量更可能是旋翼環境中的供電、耐久性與可靠度。
👥 22 則討論、評論 💬 https://news.ycombinator.com/item?id=49600901

ChatGPT Images 2.5 圖像生成模型 (★ 125 分)
OpenAI 推出 ChatGPT Images 2.5,主打更銳利的細節、較自然的光影與材質,以及更準確保留參考照片中人物或物件的特徵。公司稱,ChatGPT Images 與 API 的 GPT-Image 系列每週合計產出逾 30 億張影像;新版相較於 Images 2.0,產圖延遲最多可降低 50%,並提升在多輪編修時遵守指令、維持先前修改成果與影像品質的能力。 ChatGPT 端同步加入 Sketch,讓人可直接畫草圖作為構圖參考,再以文字補充風格與細節;另有海報、商品等常見格式的範本、可直接在影像上留言的編修方式,以及連同提示詞分享成品的功能。API(應用程式介面)則新增 GPT-Image-2.5 Flare 與 Sunburst:Flare 是多數情境的預設選項,OpenAI 稱其品質較 GPT-Image-2 高、延遲低 50%;Sunburst 的產圖時間較長,鎖定需要更精密控制的商業視覺製作。OpenAI 也表示會以 C2PA(內容來源與真實性聯盟標準)中繼資料及隱形浮水印標示 AI 製作影像,並持續檢查提示詞與輸入影像,以減少有害內容。 Hacker News 討論對實際品質抱持兩極看法。多名留言者指出,官方展示的合成派對照片仍可看見手指數量不對、人物牙齒與身體局部細節變形等問題,質疑 OpenAI 為何將未經細看便能發現瑕疵的作品列為範例。也有人認為,OpenAI 的影像編修仍可能流失原始照片的微小幾何特徵,未必勝過 Nano Banana 或 Flux 等競品;不過也有留言援引 LM Arena(以人類偏好投票評測模型的平台)排行榜,指出 Sunburst、Flare 分數高於舊版 GPT-Image-2,認為其進步值得進一步實測。 更大的爭議在於這類工具的社會影響。反對者認為大量粗糙、同質的 AI 圖像已充斥餐廳菜單、實體海報與外送平台,既缺乏美感,也可能讓商品照片與實物落差更大;有人尤其擔心二手交易平台會以修飾商品狀況、合成吸睛人物照等方式誤導買家。批評者也提到,偽造派對、整理過的房間或童年照片,可能模糊紀錄與虛構的界線。另一方面,支持者認為,小商家原本就常用罐頭圖或品質不佳的自行拍攝照片,若 AI 能協助清楚呈現餐點與價格,未必是壞事;親子趣味創作、個人賀卡與快速設計原型,也確實降低了視覺製作門檻。碳排議題同樣引發爭論,有人要求每次產圖揭露碳足跡,也有人認為其影響相較航空旅行、影音串流與其他大型娛樂活動仍有限。
👥 104 則討論、評論 💬 https://news.ycombinator.com/item?id=49614720

Qwen3.8 27B 量化版本效能測試:4 位元表現穩健,1 位元徹底失效 (★ 110 分)
Qwen3.8 27B(約 270 億參數)原始 BF16(bfloat16,16 位元浮點格式)模型約需 55 GB,超出多數消費級圖形處理器(GPU)記憶體容量;但採用 GGUF(llama.cpp 的模型檔案格式)4 位元量化的 Q4_K_M 僅 17 GB。在 Terminal-Bench 2.1(代理式程式設計測試,要求模型規劃並操作終端機完成工作)中,Q4_K_M 成績與 BF16 相當,可放入 24 GB 的 RTX 4090,還能保留約 6.4 萬詞元(token)的上下文容量。 測試比較 8 位元、4 位元、2 位元與 1 位元版本,並固定使用 F16 的 KV 快取(key-value cache,保留先前詞元鍵值的記憶體),每 3.2 萬詞元約占 2.3 GB。研究所等級科學問答 GPQA Diamond 與指令遵循測試 IFBench 顯示,4 位元幾乎沒有可量測的退步,2 位元在 GPQA Diamond 略降、在 IFBench 仍維持表現;推理強度設定的影響反而很大,最高的 xhigh 模式約會使用 8,000 個思考詞元。程式設計測試裡,2 位元雖明顯落後,但仍約在 Anthropic Opus 4.7 與 Google Gemini 3.1 Pro 的水準;而且它完成相同題目時,回應詞元量比 BF16 多約四分之一,對話輪次卻大致相同。 1 位元量化則出現斷崖式失效:GPQA Diamond 成績接近隨機猜測,最小版本甚至低於隨機基準。提高思考強度不但沒有改善,反而更容易耗盡詞元額度、最後交出空白答案。這顯示量化損害並非線性遞增,而是在某個精度門檻後突然瓦解;宣稱仍保有 72% top-1 預測正確率,並不表示能保住複雜推理與多步驟解題能力。作者的實務建議是:優先挑選在 GPU 記憶體與所需上下文容量內放得下的最佳模型,多數用途選 4 位元即可,較單純任務可考慮 2 位元,但不宜為了縮小檔案而降至 1 位元。 Hacker News 討論肯定 4 位元在 Terminal-Bench 與 BF16 相當是實用結論,但也指出統計詮釋問題:Wilson 95% 信賴區間反映固定題組成績估計的不確定性,不能直接代表同一模型重跑時的波動;作者回應認同需要多次重跑,才能更可靠地估計差異。留言者也提醒,不同量化法未必可直接類比,Q4_K_M 並非所有層都採完全均勻的 4 位元量化,因此結果不一定能套用到其他 Q4 檔案。部分人希望補測動態 3 位元量化,因為 16 GB 以下顯卡是重要門檻;也有人在 AMD RX 9070 XT、RTX 5060 Ti 等硬體上回報本機推論已具可用速度。不過反方以複雜的個人程式設計題目指出,某些任務連 5 位元都可能失敗,必須升至特定 6 位元版本或改用頂尖雲端模型;長上下文情境下,KV 快取的量化精度也被認為是下一個值得嚴格測量的關鍵。
👥 69 則討論、評論 💬 https://news.ycombinator.com/item?id=49611128

I-have-ADHD:防止程式開發代理程式把答案埋在長篇回應中的技能 (★ 107 分)
GitHub 儲存庫 i-have-adhd 為程式開發代理程式(能協助撰寫、修改與測試程式的 AI 助理)提供一套回應規則,目的是避免真正答案被冗長鋪陳掩蓋。名稱借用注意力不足過動症(ADHD, Attention-Deficit/Hyperactivity Disorder)的閱讀需求,但作者強調不需要診斷;核心原則是先給可執行的行動,再補充必要說明。範例中,代理程式不再先長談驗證流程與可能方案,而是直接指出要更新的套件、檔案位置、修改步驟及測試指令。 這套技能要求多步工作使用編號、每次回應交代進度、以分鐘提供時間預估、明確呈現完成成果,並以平實語氣說明錯誤。它也限制單次清單不超過五項,避免題外話、開場白、重複摘要與客套結尾,且每次都以一個具體的下一步收尾。作者以 MIT 授權釋出,並允許開發者自行修改技能規則,調整成適合個人工作方式的版本。 Hacker News 討論普遍認同「答案被埋在長文裡」是各類聊天機器人的常見問題,尤其不少人認為 Claude 的回應特別容易冗長、反覆交代未做的事,或在末段才放入重要細節。有人認為只要直接要求簡短回答、限定字數、要求先給結論,或在個人層級的 CLAUDE.md 放入偏好規則,就能達到相近效果;Claude Code(Anthropic 的命令列程式開發助理)也已有 Concise 回應風格可用。不過,也有使用者指出,明確說明「為何需要簡潔」往往比一句「請簡短」更能提高遵循程度。 對於為何要做成技能而非單一偏好設定,意見並不一致。技能的支持者認為可依任務選用特定指令,避免所有規則一直占用對話脈絡;反對者則認為簡潔回應屬於長期個人偏好,應放在全域設定。有評論指出,模型常在數輪後遺忘簡潔要求,可能得靠掛鉤機制(hook,於特定事件觸發時自動補送指令)維持,但會增加等待時間。另有人質疑儲存庫篇幅遠大於主要規則檔,回應則說明其餘內容多為開發期間的評估測試;至於 AGENTS.md 內要求代理程式到特定 GitHub 議題留言的文字,討論者澄清那是供維護此儲存庫的代理程式使用,實際安裝時只會帶入 skills 資料夾內容。
👥 76 則討論、評論 💬 https://news.ycombinator.com/item?id=49610631

論納維-斯托克斯千禧年大獎難題 (★ 163 分)
OpenAI 宣稱其內部 AI 系統已解決納維-斯托克斯方程(Navier–Stokes equations,描述流體運動的數學方程)存在性與光滑性問題;這是克雷數學研究所於 2000 年列出的千禧年大獎難題之一。該結果主張:原本平滑、靜止的三維不可壓縮流體,在平滑外力作用下,即使總能量始終有限,仍可能於有限時間內形成奇異點,也就是流速無限制增大。若此結論成立,代表連續介質的流體模型在特定情況下會失效,必須改以粒子尺度描述實際物理現象。 文章將解法描述為一個向內螺旋、同時沿軸向拉長的渦流;渦流核心持續縮小並加速,但能量維持有限。困難之處在於,方程中的加速度、壓力梯度、動量傳遞與黏滯效應必須大幅增加,卻又以精確方式互相抵銷,最後留下平滑的外力。OpenAI 表示,系統也以 Lean(用於機器檢查數學證明的證明助理)完成形式化證明,並稱這對應官方題目表述中的反例版本 C 與 D;此外,系統還處理了無外力歐拉方程(Euler equations,不含黏滯項的理想流體方程)的相關奇異點問題。 這項工作由約 1 萬個並行 AI 代理人(multi-agent,能分工溝通的模型實例)推進,約 88 小時找到解法,再花 17 小時以 GPT-6 Astra 完成 Lean 驗證。整體嘗試動用了約 4.9 百萬則訊息、3,000 億個輸出 token(模型處理文字的基本單位),其中納維-斯托克斯問題本身約耗費 1,300 億個 token。HN 討論者以一般 API(應用程式介面)計價粗估,僅輸出成本可能已達 1,500 萬美元;也有人認為,這種能在數日內集結大量模型探索數學路線的能力,堪稱資料中心裡的「天才國度」,並引發對通用人工智慧 AGI(Artificial General Intelligence)的進程是否加速的熱議。 不過,HN 討論的焦點也落在研究優先權與資料治理爭議。OpenAI 表示,啟動計畫前聽聞有其他數學家取得突破,後來得知紐約大學 Tristan Buckmaster 與 Anthropic 員工 Levent Alpöge 處理的是受外力歐拉方程,而非納維-斯托克斯問題;公司主張雙方證明路線與結論不同,且未讀取私人對話。然而,OpenAI 同時承認無法完全排除去識別化的產品使用資料曾改善模型,引來評論者質疑研究草稿若交由 AI 服務處理,是否可能被納入訓練並造成成果歸屬風險。另有意見指出,Lean 可檢查形式化敘述在既定公理下是否成立,但仍須由獨立數學家審閱,確認形式化命題、前提與原始千禧年難題確實一致;因此,外界普遍期待經過同行審查及克雷數學研究所的正式評估。
👥 88 則討論、評論 💬 https://news.ycombinator.com/item?id=49613262

化身為佛陀的兩位基督教聖人 (★ 102 分)
印度聖人巴拉安(Barlaam)與約沙法(Josaphat)的傳說,描述一名迫害基督徒的國王將王子約沙法隔絕於宮廷,卻無法阻止他在外出時見到疾病、衰老與死亡,進而思索人生苦難。約沙法後來遇見隱修士巴拉安,改信基督教;父親最終也皈依,約沙法則在治理國家多年後入沙漠修行。這套情節與釋迦牟尼在出家前受父王保護、見識生老病死、最後捨棄王位求道的敘事高度相似。 文章指出,這不是巧合,而是佛陀故事在跨文化傳播中被改寫的成果。傳說約於 10 世紀以喬治亞文版本《巴拉瓦里亞尼》(Balavariani)進入基督教傳統,其來源可追溯至阿拉伯文《比拉瓦爾與布達薩夫之書》;其中 Budhasaf 一名再往前可連到波斯文 Bodisav,以及梵文 Bodhisattva(菩薩)。隨著多次轉述,佛教敘事逐漸被置換為基督教聖人傳。巴拉安與約沙法曾被收入羅馬天主教較早期的殉道聖人名錄,部分東正教會至今仍紀念兩人;此傳說也曾傳至冰島,並在 1591 年由耶穌會士譯為日文帶回亞洲。 作者藉此主張,宗教之間長期會彼此借鑑、重塑故事與儀式。許多聖地即使歷經信仰更替,仍保有神聖地位;基督教也曾與各地習俗交融,例如墨西哥亡靈節融合原住民族與西班牙傳統。反方向的例子則有 7 世紀以道教、佛教語彙重述基督教教義的《耶穌經》。文章認為,能觸動敬畏、道德與智慧感的場所、節慶或敘事,往往能跨越時代與信仰體系,被不同群體以自己的方式理解。 Hacker News 的討論首先校正了標題的說法:真正對應佛陀生平的是約沙法,而巴拉安扮演的是引導他修行的師父。也有留言補充,兩人的崇敬傳統早於近代正式封聖程序;羅馬天主教後來不再將其列為正式紀念對象,但多數東正教傳統仍予以承認。討論者普遍接受這是宗教混融(syncretism,不同信仰與文化元素融合)的典型個案,卻質疑文章將基督教描述得特別善於吸收外來傳統:跨文化挪用神話本就是常態,希臘、羅馬、印度與東南亞的宗教傳統同樣如此。有人以中國禮儀之爭與印尼天主教融入爪哇儀式為例,指出中央教會權威與地方實踐之間,始終存在協商與拉鋸。
👥 43 則討論、評論 💬 https://news.ycombinator.com/item?id=49611051

LG 電視遭揭露:即使離線或待機仍會監控使用者 (★ 111 分)
Gamers Nexus 與 Level1Techs、獨立資安研究人員測試市售 LG OLED(有機發光二極體)電視後發現,裝置會掃描家中區域網路與附近 Wi-Fi 網路,蒐集手機、智慧手錶等周邊硬體資訊,以及位置與無線網路細節,並交給 LG Ad Solutions(LG 的廣告事業單位)。待機期間,電視的麥克風也可能錄下聲音;即使未接上網際網路,音檔仍會保留在電視內,待恢復連線後才上傳。 調查也聚焦於自動內容辨識(ACR, Automatic Content Recognition):此技術藉由影音取樣判定觀眾實際觀看的節目,不只涵蓋電視內建應用程式,也可辨識經由 HDMI(高畫質多媒體介面)等輸入來源播放的內容。報導指出,ACR 並非 LG 獨有,幾乎所有智慧電視廠牌都採用類似做法。LG 此前也曾被揭露,部分顯示器會自動新增蒐集裝置資訊、推送 LG 其他應用程式與 McAfee 防毒軟體廣告的程式;在輿論壓力與 Microsoft 介入後,LG 關閉了這些跳出式廣告。 Hacker News 的多數留言認為,智慧電視不應直接接上網際網路,較理想的做法是把電視當成單純顯示器,改用 Apple TV 等外接串流裝置,或選購商用顯示器。有人主張以 Pi-hole(以 DNS 網域名稱系統為主的廣告與追蹤攔截工具)封鎖電視對外連線;但也有人提醒,只攔截 DNS 不夠,裝置可能直接以 IP 位址(網際網路通訊協定位址)對外通訊,應在防火牆層級限制流量。此外,即使電視無法外傳資料,仍可能在家中區域網路盤點其他裝置,等待日後重新連線。 討論中也出現對傳聞的修正:例如電視會自動連上開放 Wi-Fi、內建行動通訊能力,或跨不同住戶建立網狀通訊等說法,目前缺乏可重複驗證的實測證據,不應與此次封包側錄結果混為一談。另一批留言則要求法規強制提供真正的「笨電視」模式,讓電視在不登入帳號、不提供個人資料下仍能正常使用;也有人呼籲進行韌體逆向工程(從成品分析內部運作),釐清各家廠商與第三方追蹤業者的實際關係。部分使用者更質疑 Windows 為何允許顯示器一接上就自動下載廠商程式,認為這種機制擴大了硬體追蹤、廣告推送與資安風險。
👥 32 則討論、評論 💬 https://news.ycombinator.com/item?id=49612329

PISA 2025:OECD 各國學生的閱讀與數學表現下滑 (★ 100 分)
經濟合作暨發展組織(OECD)公布的國際學生能力評量計畫(PISA)2025 指出,會員國 15 歲學生的閱讀與數學平均成績降至歷來最低。2015 至 2025 年間,閱讀平均少 28 分,約相當於少了一年半的學習成果;數學少 22 分,約超過一年的學習成果。科學成績在 2022 至 2025 年間大致持平,但此前長期下滑;目前 OECD 約每 5 名學生就有 1 人於科學、數學或閱讀屬低成就者,高於 2022 年的 16%。 本次評量涵蓋 91 個國家與經濟體、76 萬名學生,是歷來規模最大的一次。家庭社經地位仍深刻影響成績:條件較佳學生的科學分數平均高出弱勢學生 85 分,而差距縮小主要源於優勢學生退步,並非弱勢學生顯著進步。相對於整體趨勢,立陶宛、斯洛伐克、土耳其、蒙特內哥羅、卡達、泰國、阿拉伯聯合大公國等地的科學表現有所提升;台灣、日本、韓國、新加坡、愛沙尼亞、英國及部分中國地區,則名列科學、數學與閱讀前段班。 報告也警示數位裝置與人工智慧(AI)的使用方式比是否使用更重要。逾四分之一學生表示,多數或每堂自然科課程都有同學受數位裝置分心影響;身處這類班級的學生,學習投入度、校園歸屬感與成績都較低。未用 AI 撰寫作業草稿的學生,成績普遍優於使用者;但經常使用 AI 協助學習、且接受過辨識 AI 產出資訊品質指導者,表現又優於未受指導者。新增的「數位世界中的學習」評量顯示,近三分之二學生具備以數位工具拆解問題的基本能力,但能同時具備這項能力與科學、閱讀、數學基礎能力者僅約一半,凸顯核心學科基礎仍不可取代。 Hacker News 討論認為,平均下滑掩蓋了明顯的國別差異。有留言引述資料指出,台灣、澳門、韓國、愛沙尼亞、英國與波蘭在 2022 至 2025 年的數學成績相對穩定且高於 OECD 平均;台灣自 2015 年以來的數學分數甚至增加 9 分。相較之下,德國、法國、瑞典等歐洲國家跌幅較大。不過,也有人提醒不宜過度解讀排名,例如美國因部分州與學校參與困難,未能接觸到的學生比例偏高,樣本可能帶有偏差;西班牙則被質疑有學生因測驗不計入校內成績而草率作答。 對成績下滑的成因,留言提出社群媒體、短影音與手機分心、COVID-19 疫情造成的學習中斷、課程變革、家庭文化與社經條件等多重解釋,並指出相關現象早在生成式 AI 普及前便已浮現。AI 教育應用尤其引發分歧:批評者擔心學生直接把題目交給 ChatGPT 處理,將削弱獨立思考;另一派則強調,代寫作業與設計良好的 AI 家教不同,後者若能依學生程度調整教材、提問與追蹤進度,可能擴大個別化教學的機會。較多共識是,AI 與數位工具不應取代理解、練習與教師引導,而應在明確目的與適當規範下使用。
👥 108 則討論、評論 💬 https://news.ycombinator.com/item?id=49608697