fa
Feedback
动察Beating AI News

动察Beating AI News

رفتن به کانال در Telegram

AI新闻信息流

نمایش بیشتر
3 561
مشترکین
+224 ساعت
+647 روز
+33930 روز

در حال بارگیری داده...

کانال‌های مشابه
هیچ داده‌ای
مشکلی وجود دارد؟ لطفاً صفحه را تازه کنید یا با مدیر پشتیبانی ما تماس بگیرید.
اشارات ورودی و خروجی
---
---
---
---
---
---
جذب مشترکین
سپتامبر '26
سپتامبر '26
+61
در 13 کانال‌ها
اوت '26
+414
در 16 کانال‌ها
Get PRO
ژوئیه '26
+320
در 19 کانال‌ها
Get PRO
ژوئن '26
+320
در 11 کانال‌ها
Get PRO
مه '26
+268
در 7 کانال‌ها
Get PRO
آوریل '26
+2 277
در 12 کانال‌ها
Get PRO
مارس '26
+28
در 9 کانال‌ها
تاریخ
رشد مشترکین
اشارات
کانال‌ها
05 سپتامبر+4
04 سپتامبر+8
03 سپتامبر+29
02 سپتامبر+9
01 سپتامبر+11
پست‌های کانال
Muse Spark 1.3 Max正式开放:最强推理档终于能用了 Meta 正式开放 Muse Spark 1.3 Max。它是 Muse Spark 1.3 的最高推理强度,此前 1.3 发布时,max 还在做额外安全测试,只给少量合作伙伴预览。
Muse Spark 1.3 Max正式开放:最强推理档终于能用了 Meta 正式开放 Muse Spark 1.3 Max。它是 Muse Spark 1.3 的最高推理强度,此前 1.3 发布时,max 还在做额外安全测试,只给少量合作伙伴预览。现在安全测试完成,已经能在 Muse Code 和 Meta Model API 里直接使用。 Meta 首席 AI 官 Alexandr Wang 称,Max 在编程和 Agent 任务上明显强于 high 和 xhigh。Artificial Analysis 的 Coding Agent Index 中,Muse Code + Muse Spark 1.3 Max 得到 68 分,已经进入第一梯队。 动察 Beating 频道 · 动察 Beating 交流群

2
GPT-6 Astra支持无损换挡:长对话切思考强度不再打掉缓存 OpenAI 给 GPT-6 Astra 新增 configuration_update。在 Responses API 的同一段长对话里,现在可以随时调高或调低 reasoning
GPT-6 Astra支持无损换挡:长对话切思考强度不再打掉缓存 OpenAI 给 GPT-6 Astra 新增 configuration_update。在 Responses API 的同一段长对话里,现在可以随时调高或调低 reasoning effort,又不改写已经缓存的 Prompt 前缀。难题切 High、xhigh,简单任务再降回 Low,前面的长上下文还能继续复用。 以前这是个很隐蔽的烧钱坑。reasoning effort 会作为上下文开头的指令,中途切到新的思考档位,会导致大量缓存无法继续复用。有 Codex 用户实测,切换档位后缓存命中率曾从 98.5% 掉到 65%,下一轮重新建立缓存后才恢复到 97% 以上。 对长时间运行的 Agent 来说,这个改动很实用。碰到难题可以临时拉高思考强度,简单任务再降回来,不会只因为换挡,就让前面几十万 Token 的缓存重新按普通输入处理。 信源 动察 Beating 频道 · 动察 Beating 交流群
370
3
Artificial Analysis重做智能榜:40%权重改用私有测试 Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提
Artificial Analysis重做智能榜:40%权重改用私有测试 Artificial Analysis 更新 Intelligence Index v4.2,旨在让榜单更难被针对性刷分。私有测试权重从 20% 提高到 40%,模型厂商无法提前看到完整测试集,减少针对 Benchmark 专门优化的空间。 新版加入 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,模型要处理大量关联任务和数千份文件。GDP.pdf 则拿 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注找证据再回答。 GPQA Diamond 则被直接移出综合指数。这个研究生级科学问答测试已经接近饱和,GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已经很难区分最强模型。 重新计算后,Claude Fable 5.1 仍排第一,GPT-6 Astra 第二。Astra 得分 55,比 GPT-5.6 Sol 高 4 分。Artificial Analysis 还称,Astra 在同级前沿模型中用了更少的输出 Token。 信源 动察 Beating 频道 · 动察 Beating 交流群
259
4
OpenAI:需要扩大对齐失范事件的披露范围 OpenAI 表示,在 Hugging Face 事件发生之前,我们已经看到了一些早期迹象,表明智能体正在以非预期的方式使用互联网。随着模型能力进入新阶段,我们对对齐失范事件的披露方式也需要进一步扩展。 目前,无论是我们还是更广泛的 AI 社区,对于如何报告模型在训练、评估和部署过程中出现的对齐失范现象,都尚未形成明确的标准。这其中也包括一些并不属于传统安全事件的案例,但它们可能为理解 AI 的行为及其未来风险提供重要线索。 我们正在制定相关框架,并计划在未来几周内公布。与此同时,我们也正在与全球数十家政府监管机构就这些问题展开合作。 动察 Beating 频道 · 动察 Beating 交流群
310
5
蚂蚁百灵医疗模型Sante:仅51亿激活参数,诊断单项胜过GPT-5.6 Sol 蚂蚁百灵推出医疗健康模型 Ling-3.0-flash-Sante。它基于 Ling-3.0-flash 强化医疗能力,采用 MoE 架构,总参数 1240 亿,但每个
蚂蚁百灵医疗模型Sante:仅51亿激活参数,诊断单项胜过GPT-5.6 Sol 蚂蚁百灵推出医疗健康模型 Ling-3.0-flash-Sante。它基于 Ling-3.0-flash 强化医疗能力,采用 MoE 架构,总参数 1240 亿,但每个 token 只激活约 51 亿参数。重点能力包括医学推理、药物安全、循证检索和长流程医疗研究。 百灵公布的评测里,Sante 在 DiagnosisArena-MCQ 拿到 83.8 分,高于 GPT-5.6 Sol 的 81.9、Kimi K3 的 78.4 和 Gemini 3.6 Flash 的 76.2。MedXpertQA-Text 得分 53.9,也略高于 Kimi K3 的 53.5,但仍低于 GPT-5.6 Sol 的 60.2 和 Gemini 3.6 Flash 的 62.4。 它也没有只刷医学选择题。百灵还测试了 BrowseComp、DeepSearchQA 和 HLE with tools,重点强化「自己查资料再回答」的能力。医疗伦理和安全也单独做了测试,MedEthicAlign 得分 82.1,内部安全测试 AFUSAFE-MedSCE 得分 78.6。 Sante 已经接入 OpenRouter 和 Vercel,可免费调用。 信源 动察 Beating 频道 · 动察 Beating 交流群
303
6
微软MAI-Image-2.6-Flash卷性价比:快2.8倍,千张不到20美元 Microsoft AI 推出 MAI-Image-2.6-Flash,并在 Microsoft Foundry 开放公共预览。它是旗舰模型 MAI-Image-2.6
微软MAI-Image-2.6-Flash卷性价比:快2.8倍,千张不到20美元 Microsoft AI 推出 MAI-Image-2.6-Flash,并在 Microsoft Foundry 开放公共预览。它是旗舰模型 MAI-Image-2.6 的加速版,同样支持文生图、图片编辑、多图参考、联网获取最新信息和自动选择画面比例,重点是把生成延迟和成本继续压低。 速度是这次最大的卖点。MAI-Image-2.6-Flash 的生图速度是 GPT-Image-2 Medium 的 2.8 倍,GPU 使用效率高 72%。 但也不是纯靠牺牲画质换速度。Artificial Analysis 当前图片编辑榜里,MAI-Image-2.6-Flash 以 1311 Elo 排第三,略高于 GPT Image 2 high 的 1309;文生图则以 1297 Elo 排第八。旗舰 MAI-Image-2.6 的表现更强,目前分别排图片编辑第一、文生图第二。 微软 Foundry 上 MAI-Image-2.6-Flash 的图片输出价格为每百万 token 19 美元,旗舰 2.6 为 38 美元。Artificial Analysis 按代表性图片折算后,Flash 约为 19.5 美元/千张,而 GPT Image 2 high 约为 211 美元/千张。 信源 动察 Beating 频道 · 动察 Beating 交流群
323
7
GitHub Copilot开启多模型组队:HydraFusion成本最高降67% GitHub 给 Copilot 加了一个多模型编排系统 HydraFusion。它先判断任务该怎么做,再调用不同模型。 目前有三种方式:简单任务交给一个模型直接完成;复杂任务先让成本更低的模型尝试,结果不过关再升级到更强模型;需要复核时,则让一个模型先做,另一个不同家族的模型专门挑错,再让第一个模型修改。 GitHub 在三个编程 Agent 基准上拿它和 Claude Opus 5 对比。TerminalBench 2.1 高出 4.9 个百分点,DeepSWE 低 1.5 个百分点,CheckpointBench 只低 0.1 个百分点,基本持平;成本则分别降低 67%、36% 和 65%。 这个思路很像 Sakana AI 的 Fugu。两者都是把「选哪个模型」进一步变成「怎么组织多个模型」。区别是 Fugu 本身就是一个训练出来的指挥模型,会学习怎么调用不同 Agent,甚至能递归调用自己;HydraFusion 目前仍然是在 Single、Cascade、Critique 三种固定执行模式里选择,更像把多模型调度直接塞进 Copilot。 HydraFusion 已向所有 GitHub Copilot 套餐开放研究预览,目前需要在 Copilot CLI 的实验功能中开启。GitHub 也提醒,现阶段最适合一次说清楚的单轮编程任务,多轮长任务还在继续优化。 信源 动察 Beating 频道 · 动察 Beating 交流群
305
8
OpenAI被指悄然调整GPT-6Astra评测数据,部分指标让竞争对手「变差」 OpenAI 自 9 月 3 日发布 GPT-6 Astra 后,多项模型评测基准数据被持续调整,部分修改使 Astra 表现更优,同时部分竞争对手模型的成绩出现下滑,引发外界对 AI「刷榜」和评测透明度的质疑。 其中,Astra 的幻觉率曾从 4.2% 下调至 2%,GPT-5.6 Sol 则从 12.2% 降至 9.4%,随后两者又恢复至 4.2% 和 12.2%。在数学评测中,Anthropic 的 Fable 5.1 得分也曾从 87.8% 降至 78%,目前已回升至 83%;GPT-5.6 Sol 则从 83% 降至 80.5%,后恢复至 83%。 此外,Astra 在 ARC-AGI-3 评测中的成绩从发布前草稿的 98.6% 提升至最终页面的 99.99%,其编程评测成绩也从 57.7% 小幅上调至 57.9%。OpenAI 表示,评测结果会受到模型版本、工具配置、推理级别及测试运行等因素影响,此次调整是为了确保数据更准确地反映模型的最佳性能。 不过,斯坦福大学研究人员认为,频繁重新运行评测可能涉及所谓「Benchmaxxing」,即通过调整测试条件最大化基准成绩。业内人士指出,随着 AI 模型竞争加剧,评测数据已成为衡量模型能力及争夺市场的重要工具,如何提高基准测试的透明度和可复现性正受到越来越多关注。 信源 动察 Beating 频道 · 动察 Beating 交流群
990
9
Anthropic IPO或推迟至10月中旬,拟冲击2万亿美元估值 据路透社援引知情人士消息,人工智能公司 Anthropic 的 IPO 计划正向 10 月中旬调整,最早可能于 10 月中旬启动路演,并在 11 月美国中期选举前完成上市。公司原计划最早于下周公开 IPO 招股书,目前预计将推迟至 9 月底。 此次时间调整意味着 Anthropic 可能冲击最高约 2 万亿美元的上市估值,若成行,将成为历史上规模最大的 IPO 之一,也将成为资本市场检验 AI 行业增长潜力的重要案例。 知情人士透露,Anthropic 正在推进敲定一笔 150 亿美元循环信贷额度,参与融资的银行分析师预计将在招股书公开前与公司会面。摩根士丹利、高盛、摩根大通和花旗等机构正在参与此次 IPO 筹备工作。 此次 IPO 预计将受到市场高度关注,并可能与 OpenAI 等其他 AI 公司的潜在上市计划同期推进。 信源 动察 Beating 频道 · 动察 Beating 交流群
312
10
GPT-6 Astra全量上线:OpenAI连送两次额度重置 OpenAI 已将 GPT-6 Astra 向 Plus、Pro 和 Business 用户全量开放。昨天 Astra 还处在分批推送阶段,很多 Pro 用户也用不了;今天 Plus 和
GPT-6 Astra全量上线:OpenAI连送两次额度重置 OpenAI 已将 GPT-6 Astra 向 Plus、Pro 和 Business 用户全量开放。昨天 Astra 还处在分批推送阶段,很多 Pro 用户也用不了;今天 Plus 和 Pro 用户都已经可以在 ChatGPT Work 和 Codex 中使用。核心产品负责人 Thibault Sottiaux 称,团队的系统扩展能力比预想更强,因此很快完成了这轮全量上线。 Astra 首发时只给少量企业客户。OpenAI 原本预计要用几天逐步开放。大量付费用户迟迟拿不到后,Sam Altman 还为这次「混乱的发布」道歉。现在团队称系统扩展能力比预想更好,因此提前把 Plus 也发完了。 原本承诺的补偿也照发。符合条件的现有 Plus、Pro 和 Business 用户,9 月 3 日和 4 日各能拿一次 banked reset。它相当于一张可以以后手动使用的 Codex 满额重置券,会刷新 5 小时和周额度。北京时间 9 月 5 日 11:00 前新开账号或升级套餐,也能拿到这次重置。 Plus 虽然能用 Astra,但额度不算宽裕。OpenAI 当前估算,Plus 每 5 小时大约可跑 5–45 条 Astra 本地消息,GPT-5.6 Sol 则是 10–100 条。实际消耗取决于任务长度、推理强度和工具调用。 信源 动察 Beating 频道 · 动察 Beating 交流群
327
11
小米发布通用表格数据基础大模型Xiaomi-TabLDM 小米今日正式发布 Xiaomi-TabLDM,即通用表格数据基础大模型。 据介绍,Xiaomi-TabLDM 采用单一预训练模型及统一默认配置,可直接适配不同表格数据集,无需针对每项任务重新训练、调参或进行后置集成,即可完成分类与回归预测。 小米表示,该模型旨在降低表格数据建模的使用门槛,为不同场景下的结构化数据分析与预测提供通用基础能力。 信源 动察 Beating 频道 · 动察 Beating 交流群
312
12
Anthropic筹备上市,摩根士丹利、高盛或获关键承销角色 据英国《金融时报》报道,人工智能公司 Anthropic 正接近确定摩根士丹利 (MS.N) 和高盛 (GS.N) 在其首次公开募股中的关键角色,并计划最快于下周公布上市文件。 知情人士称,摩根士丹利目前处于「主承销左席」领先位置,负责 IPO 战略顾问工作;高盛预计将担任稳定价格代理,负责公司上市初期交易稳定工作。摩根大通 (JPM.N)、花旗集团 (C.N) 和巴克莱 (BCS.N) 等银行也预计将在交易中担任重要角色。 Anthropic 预计将于 9 月底或 10 月初在纽约上市,此次 IPO 将测试投资者对快速增长 AI 公司的需求。 动察 Beating 频道 · 动察 Beating 交流群
332
13
AI云计算公司Nscale拟IPO前融资35亿美元 专注人工智能云计算的 Nscale 正在寻求 IPO 前融资,计划筹集最多 35 亿美元资金。据知情人士透露,这家总部位于伦敦的公司拟向投资者出售最多 15 亿美元可转换债券,并寻求英伟达提供约 20 亿美元融资支持。 知情人士称,丹尼尔·勒布旗下 Third Point 将领投可转债投资,高盛参与筹资安排。Nscale 此次融资后还计划进行首次公开募股,此前报道称 IPO 可能筹集约 30 亿美元。Nscale 向投资者介绍称,公司合同总价值约 103 亿美元,其中包括与 Anthropic 达成的 450 亿美元算力供应协议。 公司预计未来年收入约 181 亿美元,调整后息税折旧摊销前利润约 136 亿美元,但强调这些数据仅为示例性估算,并非正式指引。Nscale 正在挪威建设供微软使用的大型数据中心园区,并在美国西弗吉尼亚州布局大型项目。目前公司已采购约 19.4 万颗英伟达 Vera Rubin GPU。 信源 动察 Beating 频道 · 动察 Beating 交流群
355
14
Anthropic自研支付技术布局,或将蚕食Stripe的市场份额 近期招聘信息显示,Anthropic 正计划自研更多账单结算、欺诈检测以及其他金融基础设施,并评估哪些支付相关服务可以自主搭建,而不再依赖外部服务商。 招聘信息表明,Anthropic 尚未最终敲定,在支付、计费、税务处理等领域,是继续自研更多工具,还是持续采购外部服务商方案。其中一个计费方向的资深软件工程师岗位,需要协助公司做技术选型:哪些业务基于外部服务商平台继续开发,哪些场景需要围绕外部平台搭建自身底层基础模块。 动察 Beating 频道 · 动察 Beating 交流群
418
15
OpenAI Agent 5月就开始越界:疑似6月已被内部发现,但直到现在才曝光 OpenAI Agent 的越界时间线又被往前推了两个月。新公开的研究发现,另一批 OpenAI Agent 5 月 11 日就开始尝试修改公网 Wiki,5 月 24 日成功写入一个已有约 25 年历史的德语 Wiki DSEWiki。这起事件此前一直没有公开。 这批 Agent 当时在做限时网页检索任务。研究者判断,OpenAI 原本只允许它们读取互联网,禁止往公网写内容。具体限制方式是允许 GET 请求、拦住 POST 请求。正常网站里 GET 只负责读取,但 DSEWiki 使用的老式 Wiki 系统偏偏支持用 GET 直接修改页面。Agent 找到这个空子后,就绕过了原本的写入限制。 一开始,它们主要拿 Wiki 保存任务需要的链接。到了 6 月 16 日,行为开始明显升级:大量 Agent 直接在里面互传后续题目和答案,让跑得慢的 Agent 可以直接抄前面的结果。它们还分享绕过沙箱网络限制的方法。一次记录中,一个 Agent 发出方法后,14 分钟后就有另一个 Agent 表示已经复现成功。 管理员发现异常后开始删页面。Agent 很快发现对方按字母顺序清理,于是复制了一份内容,把页面名改成 ZZZ 开头,希望尽可能晚一点被删。研究者还发现,6 月 21 日开始出现来自 OpenAI 公司网络、行为像人工浏览的访问。第二天,Agent 的编辑活动突然几乎归零。因此他们推测,OpenAI 内部可能在这时发现了这个留言板。 两名知情人士称,OpenAI 数周前已经知道这起 DSEWiki 事件,但此前没有对外披露。OpenAI 表示,两起事件彼此无关,并称公司一直在善意披露相关事件。 信源 动察 Beating 频道 · 动察 Beating 交流群
382
16
Gimlet估值冲到30亿美元:从调度不同芯片做到自己建数据中心 AI 推理初创公司 Gimlet Labs 完成 3 亿美元新一轮融资,估值达到 30 亿美元。Andreessen Horowitz 领投,Arm 和微软旗下 M12 新加入。Gimlet 做的是多芯片推理云,把一次 AI 推理拆开,让不同阶段跑到更合适的芯片上。 这家公司融资速度很快。约半年前,Gimlet 刚完成 8000 万美元 A 轮。再往前不到一年,它的种子轮只有 1200 万美元。三轮合计融资 3.92 亿美元。CEO Zain Asgar 称,这一轮很快就谈成,因为公司收到了多份投资方主动递来的投资意向书。 Gimlet 原先主要提供芯片调度软件,现在已经开始帮客户搭数据中心,还在建设自己的数据中心。不同芯片对散热、温度和服务器配置的要求并不一样,只把软件写好还不够,整套机房也得跟着重新设计。 例如 AI 推理里的预填充和解码,一个更吃计算能力,一个更依赖内存带宽。Gimlet 可以把它们分给不同厂商的芯片处理。Arm 这次既投钱也合作,双方还会让 Gimlet 的软件适配更多 Arm 芯片。 信源 动察 Beating 频道 · 动察 Beating 交流群
381
17
字节跳动拿下300亿美元史上最大贷款:AI烧钱烧到资产负债表 字节跳动拿下约 296 亿美元银团贷款,创公司历史纪录,也是今年亚洲第二大美元贷款,仅次于软银约 400 亿美元的过桥贷款。公司原本只准备借 200 亿美元,但银行认购需求很强,最终把规模直接加到近 300 亿美元。 这笔贷款没有被披露为专门用于 AI,名义用途是一般公司用途。但字节正在大幅提高资本开支,重点扩建 AI 数据中心和算力基础设施,同时继续投入豆包、Seedance 等模型,并扩张面向企业客户的云业务。 中国大厂的 AI 融资规模也在继续放大。阿里巴巴上个月刚通过配股融资约 102 亿美元,并明确全部投向 AI。字节这次则把公司史上最大一笔贷款拉到近 300 亿美元,AI 竞赛已经从模型能力一路烧到资产负债表。 信源 动察 Beating 频道 · 动察 Beating 交流群
354
18
DeepSeek豪购华为芯片:16万张Ascend 950DT塞进内蒙超级集群 彭博援引知情人士称,DeepSeek 计划在内蒙古乌兰察布正在建设的 AI 数据中心部署至少 16 万张华为 Ascend 950DT。若按计划落地,它将成为目前已知最大的华为 AI 芯片集群之一。DeepSeek 还想买更多,但华为产能暂时跟不上,完整交付可能超过一年。 这批 950DT 将用于运行 DeepSeek 模型,DeepSeek 暂无计划拿它训练。DeepSeek 迄今仍主要依赖英伟达 GPU 完成核心训练。 16 万张芯片还只是整个项目的一部分。DeepSeek 此前计划在乌兰察布建设约 1GW 级 AI 数据中心,并从当地其他运营商租用额外算力。 信源 动察 Beating 频道 · 动察 Beating 交流群
335
19
Adaption把造训练集交给AI:不用原始数据,描述目标就能生成 Adaption 推出训练数据生成工具 Invent a Dataset。普通合成数据工具主要负责生成样本,Invent a Dataset 连训练集怎么设计也一起做了。 用户只要描述希望模型学会什么,它会自己设计数据结构,再生成可以直接拿去训练的样本。不需要先准备原始数据、设计字段格式,也不用提前写详细的标注规则。 比如你可以要求模型学会「按照公司的标准总结商业文件」,或者「把客服请求分到不同部门」。Invent a Dataset 会根据目标决定需要哪些训练数据,再批量生成对应样本。 生成的数据还能直接交给 Adaption 的 AutoScientist。它会继续调整训练数据和训练参数,反复训练、评测,直到效果基本不再提升。这样从一句任务描述开始,就能一路生成训练集,再训练出针对这个任务的模型。 信源 动察 Beating 频道 · 动察 Beating 交流群
329
20
Anthropic预览Function Hooks:Claude Code插件能直接改界面 Anthropic 正在测试 Claude Code 的新扩展机制 Function Hooks,目前还没有上线。它允许插件直接用 TypeScript 函数接入 Claude Code,甚至修改 React 界面的组件、显示内容和交互。现有 Hooks 则主要是在特定事件发生时调用命令、HTTP、MCP、Prompt 或子 Agent。 Function Hooks 的工作方式类似 Express、Koa 的中间件,可以让多个插件层层嵌套。插件通过一个受控的 $ 对象执行操作,管理员还能收走其中某些能力,让后面的插件无法调用。一个 Hook 也可以监听所有事件和插件通过 $ 发出的操作,用来统一记录审计日志。 最大的变化是,Claude Code 插件的能力开始深入到界面和交互层。官方演示里,Claude 可以一句话生成一个插件,在工具输出进入模型前自动遮掉密码等敏感信息。另一个插件可以直接修改 Claude Code Desktop 的显示,把敏感内容藏起来,鼠标移上去才显示。 信源 动察 Beating 频道 · 动察 Beating 交流群
328