哎呦不错:第1420期

@ 牛津 - 小裁缝: 年轻人毕业进入社会,对这个社会的认知是逐渐清晰起来的。在校园里被保护得太好了,所以就业特别重要,能帮助青年人尽快融入社会。现在很多年轻人不是失业的问题,是压根就没就业,啃老的越来越多。
@ 杜松子居士: 如果问我真正羡慕什么人吗,我最羡慕的人是无穷小亮。这人怎么完全在做专业对口、自己热爱还有编制的工作。既有社会影响力又不至于置身风暴中心。每天纯然自得地和鸟兽虫鱼花草树木混在一起,时时去奇崛瑰丽的地方出差。科普又是功德无量的事。他还是北京人。
@ 野小合 “《道德经》5000 多个字,没一个字是在说努力的,里面每一个字,说的都是:找一个适合自己的环境让自己闲下来,这才是生命的终极意义。”
@ 透明人間的蒸气: 所有以 “原生家庭理论”(在中文互联网上起源于武志红)来做角色分析的视频(我不是说 stellaa,而是另一些),真的土到我看不下去。
【“因为她小时候穷”“因为她是苦出身”,才变成这样的】
我觉得这是一种虚假的善意,虚假的理解,且是一种真正的势利,尽管这种势利用善解人意的语气包装了一遍。
周芷若的行为,明明有那么多东西可以诠释,有些 up 主诠释了半天就回到 —— 因为她是个渔家女啊!穷人出身就是纠结内耗,大小姐才懂得自由松弛嘛(我要怪 tvb 那个你从哪来就回哪去的狗屁结局吗?)
仅从周芷若而言,拿掉她是渔家女的设定,直接从峨嵋小师妹写起,除了影响她和张无忌的姻缘线,什么都不影响。她该温顺温顺,该狡猾狡猾,该杀人杀人。
@tombkeeper: 有一种常见的提问句式:“哒哒哒哒哒,要不要嘟嘟嘟嘟?”
假设这种问题存在答案,就意味着所有 “哒哒哒哒哒” 的人都适用该答案,即 “要嘟嘟嘟嘟”,或 “不要嘟嘟嘟嘟”。而这显然是荒谬的。
@ 唐宁街的猫先生: 以炒股的经验,还有人喊追高的时候往往不是高,遇到妖股甚至算山脚。同样的,喊抄底时,往往也不是底,下面深不见底,抄底就是换一批人被套。
婚姻房子孩子确实已经是深不见底了,考公现在很多博主也劝不要全职备考,除非自认是有 100% 把握的大神
@ 牛叔: 家里领导笑眯眯问好久没听你说股票挣钱了,又套住了吧?我说:看不起谁呢,我们价值投资者持仓回调只会让未来空间更大了。
@ 北漂民工的日常: #如果你出生于 1992 年至 2003 年之间# 这个热搜能上,说明戳到了一整代人。
把时间线摊开看:出生赶上一孩政策;读书赶上扩招,本科通胀、考研续命;毕业赶上房价最后一轮暴涨,如果你很努力,那大概率已经套在房子里面了。
工作三五年赶上行业收缩与优化;三十岁前后,还要被问一句” 为什么还不结婚生娃”。
最扎心的是 —— 这代人从小被教育努力就有回报,可它不是常识,是某个窗口期的红利;而那个窗口,正好在这一代人成年的时候基本接近关闭。
@ 时代如风啊: 老百姓健康意识提高了,为了健康都在家做饭了
孩子们太老实了
@ 真主钦点仁波刀: 孩子太实在,只知道医学院系统能庇护导师,却不知道好好利用也能庇护自己,完全犯不着拼出一条命。
你就趁着工作日大白天揣着菜刀大大方方上老板的门,确保能被足量的同行、外科室、患者、行政看到,边哭喊边劈老板的桌子,说自己的情况,声称事到如今大家都别活了…… 不用真的伤人,也不要拦着别人跑路。
实在下不了手,拿鞭炮、老鼠、大便、广场舞音箱去轰他鳖孙的办公室,这难度总是很低了吧。
那么很神奇的,这个系统忽然就会保护你了,准假了,会向内压事了,懂得轻重分寸了,也不压你毕业了。
谁压你,你都不一定受着,要充分利用交换比呀。
@ 寝取的史官: 看到过不少研究生被导师压榨的新闻,不但要在实验室干活,还要给导师干私活,甚至要接送孩子。想来导师也是蛮厉害的,把学生压榨成这样还敢让学生接送自己孩子?
还是吃准了随便怎么奴役学生都无所谓,吃定了学生不敢反抗。
因为能走到研究生这步的学生都是经过长期规则教育的典范,从小学开始每天在一套规则中熏陶,按规则上学,按规则学习,按规则考试,考试考的就是对这套规则逻辑的掌握程度。有的人在过程中掌握规则利用规则,而有的人变成了规则的形状,只会遵循规则。于是就出现很多在以某种规则下考试成绩来决定录用的场景里痛苦无比而又没有作出任何反抗的例子。
大公司喜欢卡学历不是没有道理,学历越高,刺头就越少。因为反抗不在规则范畴里,根本想都想不到。
日本已经三分之一人口领养老金了
@ 地球知识局: 这你能信?日本已经三分之一人口领养老金了。相比年龄段占比这个显然更直观,这先遣服正在上演老龄化的终极版本。
就在昨天(9 月 15 日),厚生劳动省大臣公布了最新数据(图 1):全日本 100 岁以上的老人已经突破 10 万人,其中女性占了 87.5%。日本的人口 1.2 亿,在全世界只能排到第 12,但百岁老人的数量早已世界第一。
如此高寿的人口,养老金压力得多大?早在 2024 年,厚劳省《令和 6 年财政验证报告》就明确提到,“从日本全国来看,每 3 个人里就有 1 个人在领取养老金。”(日本全体で見ると、国民の 3 人に 1 人が年金を受給しており)。这弄得两边都吃力,发养老金的依赖财政输血,领养老金的也很不轻松。
一般人知道日本的工资和物价偏高,可能以为养老金也高,这纯属误会。像自雇人士、农民、无业者一般只能领基础养老金,缴满 40 年,一个月最高 70608 日元(折合人民币约 3000 元)。但有些人中途断缴,实际平均每人只能领到 5.7 万日元(不到 2500 元人民币),在城市里可能连房租都不够。
一般的公司职员或者公务员会叠加一笔职业年金,加上基础养老金平均每个月 14.7 万日元(约 7000 元人民币)。其中男性平均约 16.6 万日元,女性平均只有约 10.7 万日元。
大多数人只领养老金不太够花,还得去拖着一把老骨头继续打工。在日本便利店、出租车、物业保安等等岗位上,经常能看到七八十岁老头老太。日本现在急缺劳动力,也很需要退休老人应干尽干。政府规定,老人只要工资加养老金不超过一定限额(如 65 万日元),养老金完全不受影响,超过了也只是扣一部分养老金。
不过,一手领养老金一手拿工资,还真不一定能宽裕。很多七老八十、八九十的老头老太,还有一些躺平的不肖子孙要养。社会学把这种现象称为 “8050 问题”,就是 80 岁的父母养 50 岁的儿女。
根据内阁府 2018 年的全国调查,日本 40-64 岁的中老年啃老族推算达 61.3 万人;如果算上 15-39 岁群体,全国总数超过 100 万人,按家庭计算约在 15 万至 50 万户之间。
说实话,如此庞大的人口,纯靠社会保险费早已养不起了。70 年代日本是 8.5 个劳动年龄人口养 1 个退休老人;到了 2025 年,变成 2.0 个人养 1 个老人。据官方测算,到 2070 年将变成 1.3 个人养 1 个老人,接近一对一托举。
如今日本的基础养老金非常依赖国家财政的转移支付,每年仅养老金一项,国库补贴就高达十几万亿日元。2019 年时任首相安倍晋三把食品饮料之外的消费税从 8% 加到 10%,主要就是填补以养老金、医疗为主的缺口。为了确保养老基金不会破产,日本政府每年都得依据人口数据和物价来调整养老金发放数额。
日本老龄化程度世界领先,给问题起名的能力也是一流:8050 问题、老老介护、孤独死、无缘社会、就业冰河期…… 每一个都简洁、好记、好传播。先命名,再共处,可能也算一种解法。
天才的洞见,不该撞碎在算力墙上
大模型竞赛其实是一场看不到尽头的搏杀。
DeepSeek V4、Kimi K3 横空出世后,很多人乐观地认为中美大模型差距又被追赶到半年差距,甚至开始盘算下一阶段就是拼电力,优势在我。这才没几天,就忘却了 2025 年 2 月前,那被模型代差巨大支配的日子,那时候可不是 “差半年”,是差一个时代。
其实,那一次代差的缩小,太靠几个天才灵光闪现的架构创新,而现在,真实的代差再次被拉大。
9 月 3 日,OpenAI 发布了 GPT-6 Astra。同一周,Anthropic 的 Fable 系列又把 agentic 的上限抬了一截。可能还是有人说,从跑分来看,国产顶尖模型也不比 Astra、Fable 差多少啊,成本还更低。
从综合智能指数算,Artificial Analysis 上 K3 是 57.1,在 7 月份时只和 Fable 5 相差 2.8 分,但现在 Astra 是 61 分,Fable 5.1 是 66 分,差距再度拉大。另从能力边界来看,FrontierMath Tier 4 上,K3 的准确率只有约 39%,而 OpenAI 和 Anthropic 的前沿模型都超 90%。至于 ARC-AGI-3,ARC Prize 官方页面上 K3 、DeepSeek V4 的成绩栏都是空白。
分数体现的是,中国模型在有标准答案、能自动判分、公开数据覆盖得住的赛道表现得还不错,比如 SWE、知识考试。但在真实工作任务、长程工具链以及还没有标准答案的领域,比如带工具的 HLE、computer use、研究级数学、offensive security,美国 SOTA 模型定义了新赛道,这些赛道,中国模型要么缺席,要么差距大到十几个百分点、几百个 Elo。
更难绷的是,仅仅两个月时间, Anthropic 就从 Opus 5 走到 Fable 5.1,OpenAI 就从 GPT-5.6 Sol 走到 GPT-6 Astra,小版本迭代从四个月压缩到两周,不靠架构灵感,全凭算力充裕到可以支撑高频次的完整训练周期。而国产模型就连小版本迭代仍需等上数月。
美国 SOTA 模型领先固然有架构、算法、数据、后训练的先发优势,但更大的优势还是在充沛的算力情况下,可以做超大参数、追求等效智能最大化,而因为算力的硬约束,中国模型不得不另辟蹊径。
所以,谈差距几个月其实没什么意义,只不过把 “能力” 这个多维度的东西,只取几个指标,硬压成了一个时间差。
时间差这东西,没法做对照实验去验证。真要检验,只有一个办法,那就是冻结比较,也即中国最强的模型,要花几个月才能达到 Astra 今天的水平。
最近,Anthropic CEO Amodei 放话,说前沿模型已经强大到必须放慢能力提升的速度。奥尔特曼、马斯克都点了头。这话听着更像是硅谷精英在抢占道德高地,甚至不排除是想借此拖住对手,为 IPO 造势。但不管动机是什么,“刹车” 从来是领先者的特权,不是追赶者的选项。他们可以喊,我们不能跟。
我绝非是在长他人志气灭自己威风。恰恰相反,看清差距在哪、为什么会有这个差距,才是追赶的前提。把部分跑分接近当成能力接近,把 “半年差距” 当成理所当然,才是真正的危险。
SOTA 模型定义的是未来生产力,以期涌现新产业、重塑旧产业,不是为了跑分。在未来生产力的赛道上,算力不是背景条件,就是入场券,并且,这张入场券越来越贵。
01
其实,要说算力不足,国产模型只能被迫走性价比路线,也只是说了前半句。
2024 到 2025 年,大模型竞赛最稀缺的是转化效率,那是 DeepSeek 的主场。MLA、FP8、GRPO 这些原创性创新是实打实的,是算力有限的条件下被逼出来的效率创新,同样,也是 DeepSeek 团队对大模型是压缩 - 预测概率生成机制的深刻理解,在数学 / 应用数学层面,把注意力机制、数值精度、强化学习目标函数都重新拆解过一遍。
那真是天才般的洞见,技术社区讨论热度极高就是证明,后面非议再多也改变不了那些公式、算法的价值,它们已经开源,全球很多模型都往这条路线收敛,DeepSeek 一度拿到了范式定义权,那时候性价比是进攻武器。
但到了 2026 年,攻守再度易形。
黄仁勋在 Astra 发布当周透露,GPT-6 Astra 的预训练用了超过 10 万块英伟达 Grace Blackwell 芯片(NVLink72 架构),是 OpenAI 历史上规模最大的训练任务之一。
可能有人会说,10 万块英伟达 Grace Blackwell 芯片就只提高了这点分数,性价比是不是太低了?
这个质疑恰恰暴露了跑分思维的盲区。分数只是 Astra 的表层产出,“烧掉” 10 万块卡不是把综合指数从 59 拉到 61,是趟出了条没有标准答案的赛道。GDPval 考的是真实经济场景里的工作产出;FrontierMath Tier 4 97.6%,考的是研究级数学的原创推理;ARC-AGI-3 在 OpenAI 专用适配框架下报 99.9%,考的是抽象泛化能力。
除了编程、金融分析、科研辅助这些常规用途,还意味着网络攻防战的天平将向有最前沿模型的一方倾斜,作为攻击方能长程自主渗透,作为防守方能实时漏洞挖掘。在芯片设计方面,EDA 拥有工业界最完美的验证器,Synopsys、Cadence、Siemens EDA 三家都转向长程自主 Agent。先有能力,后有应用,谁也不好说在超强能力供给之上,会生长出多少新应用。
而三个独立能力同时提升,既可能是强 harness + 验证器饱和 + 评测定向优化的结果,也可能就是 Open AI 后训练生产线已经找到了通用方法,让 RL 飞轮、AI 训 AI、合成数据在十万卡集群上日夜不停地自我对弈,能在任何有验证器或有人类评的基准上刷到饱和,将基准从能力的数分切换到生产力的报表。
无论哪种可能,前沿模型在预训练和后训练都走上了超大集群、重资本、强互联依赖的路子,训练集群从万卡迈向了十万卡。最前沿模型已经不再单纯追求更高跑分,而在于打造更有生产力的机器。
当然,如果有人就此气馁说,看吧,人家十万卡、数据又多、工程师更顶尖,过去是参数拼不过,现在就更追不上了。
这种投降主义思维要不得。2025 年 2 月之前,中国模型是愁云惨淡,连推理链怎么复现都搞不掂。而现在有 DeepSeekV4、Kimi K3、Qwen 3.8 Max、GLM5.3、Hy4 等等模型,打通了架构设计 - 预训练 - 后训练全链条,就更没有理由认为不能趟出新路。
其实,OpenAI、Anthropic 也不是拿到了什么天顶星技术,Astra、Fable 的成功,不是只有十万卡集群,还有拿十万卡集群做好后训练。
次世代模型能力的边际增量已经越来越来自 RL 飞轮、AI 训 AI、合成数据,这恰恰最吃算力,吃得很凶。OpenAI 的 GPT-Red 一代代接入 RL 训练,Claude Code 和 Codex 让用户付费生产精英轨迹,这些轨迹回炉变成下一代的后训练燃料。
既然方式知晓了,那么解题也就有了抓手。
中国模型在能自动判分的赛道并不差,是因为训练燃料是现成的,题库、测试、公开数据。但现在到了没有标准答案的赛道,燃料得自己造,要么花大价钱请人类专家标注(单条长程数据上千美元),要么用海量算力跑 RL 环境自我对弈。前者中国模型厂还在积累,苦功夫笨功夫,而后者,那就想办法增加算力。
是的,算力约束不仅决定了中国模型训练得起多大的模型,更决定了能造得起多好用的训练燃料。前者决定参数规模,后者决定能力边界。Astra 和 Fable 的发布表明,美国前沿已经把竞赛重心从前者搬到了后者,这是目前中国模型在现有算力预算下结构性够不着的战场。
一年多前,DeepSeek 用惊艳的数学架构将性能墙往前推,用有限的算力制造出不输当时前沿的模型,现在到了重新思考如何突破算力墙的桎梏了。
02
其实,梁文锋也早就意识到这点。
在投资人分享会里,他亲口承认,中美 AI 的差距,主要是算力资源的差距。他算了一笔账,训练一个跟美国同等规模的模型,需要 5 万张 GB300,或者 20 万张华为 950。DeepSeek 当时大概只有 2 万张 H 卡等效算力,大部分还是此前一两个月刚到货的。
他对算力采购的态度是能买多少就买多少,就怕采购的钱花不出去。
注意这组数字的对比:由于囤得早,DeepSeek 是中国所有模型厂里算力条件最好的之一,2 万张 H 卡等效。而 OpenAI 单 Astra 一个训练任务就用了 10 万 + 块 Blackwell。这已经不是 2 倍、5 倍的差距了,是数量级的差距。
我们预估 DeepSeek 下代模型,会从注重极致压缩,切换到更注重极致推理。因为效率的边际收益已经收窄,下代模型要往真实工作任务、长程工具链、无标准答案的赛道上走,就必须把重心从压缩 - 预测的效率端,移到 RL 飞轮、合成数据、精英轨迹回炉,超大参数 + 后训练,算力更吃紧。
中国和美国的算力差距有多大,按 Bernstein 估算的是 2025 年中国 AI 算力数量大约是美国的 15%,在自主可控算力方面,Epoch AI 则悲观认为华为 2026 年的 AI 算力产量不到英伟达的 4%。
差距是很大,但国产芯片已经做了很多努力,从无到有,中芯 N+2(等效 7nm)是全国唯一能规模量产 AI 芯片的先进制程产线;昇腾 950 超节点在推理性能 / 价格上已经可以对标 GB200/GB300,寒武纪在部分 workloads 上也站稳了脚跟,等等。目前,国产主流大模型都已经或正在与国产算力集群进行推理适配。
没有半导体产业链的厚积薄发,今日中美算力差距更大。
但与算力需求相比,国产算力产能还是硬约束。按产业链估算,2026 年国产 AI 芯片需求约 420 万颗,中芯供给约 260 万颗,这 260 万颗要分给所有人:华为自己要,寒武纪要,海光要,地平线要,壁仞要,摩尔线程要,阿里平头哥要,全在门口排队。HBM 是另一个瓶颈,国产 HBM 的产能、良品率爬坡决定了封装厂的产出上限,这个瓶颈 2027 年前仍卡得死死。
据估算,2026 年昇腾 950DT 的产量只有 “数十万颗”,而 DeepSeek 在内蒙古乌兰察布的部署就签了 16 万颗,履约期至少 18 个月。换句话说,DeepSeek 一家的一笔订单,就吃掉了国产先进芯片全年产量的大头,而这 16 万颗昇腾 950DT,目前主要用于推理,能否用到训练上,还得看新进展。
这不是黑国产芯片,恰恰相反,国产芯片在推理侧已经立住了,推理算力自主可控,能腾出手来攻克训练算力自主,从技术角度,目前缺的是能用于前沿训练的先进算力。
训练对单卡算力密度、互联、软件生态的要求是推理的数倍。950DT 的设计初衷包含训练,但 DeepSeek 选择不拿它训练,原因可能除了算子层面的适配问题,就是 20 万张对 5 万张的换算,加上生态成熟度,训练用国产卡目前等于用 4 倍的卡、跑 2 倍的工程风险。
国产下代模型的预训练算力需求,只会更大。去年国产旗舰模型的参数规模还在一万亿量级,今年已经跳到 2.8 万亿,明年业界预期是 3-5 万亿,参数量近乎翻一倍,那预训练所需的算力就不是翻一倍,是翻好几倍,数据规模、通信开销、显存占用、训练稳定性,每一样都跟着膨胀。
如果国产芯片的产能和训练生态要到 18 到 24 个月后才能跟上,那么在此期间,国产下代模型的预训练算力缺口会扩大,等产能到位再补训练,等于把下一代模型冻结在今天的参数规模、性能位阶上,而 OpenAI 和 Anthropic 很可能又把赛道往前再推了一个身位,定义了新一代范式。
除了预训练,后训练的算力黑洞也在扩大。如果 Astra 预训练烧了 10 万块卡的算力,后训练的量级大概率不在它之下,甚至更高。预训练是一次性的、可以规划的大规模同步任务,而后训练是常态化、多轮次、低效率的算力吞吐,同样一块卡,跑 RL 的吞吐可能只有跑预训练的几分之一,再加上同一个 prompt 要采样多次、轨迹可能很长、还涉及多轮工具调用,后训练的 GPU 小时消耗自然膨胀。
OpenAI 的 GPT-6 Astra、Anthropic 的 Fable ,全是后训练强化的 “怪兽”。两年前,前沿实验室预训练与后训练的算力比大约是 10:1,半年前已经接近 1:1,现在这个比例正在反转。
如果说,训练算力的缺口靠等国产产能爬坡还能勉强算出一个时间表,那么,后训练的算力需求是持续性的,缺口会一直张着,而且越往后越大。
03
模型层的竞赛日新月异,算是回合战,芯片层的战争是持久战,两者本来就不在一个时间尺度上,芯片层是需要数年乃至十几年的积累,不可能毕其功于一役,而模型层迭代的窗口以月计,显然等不了,也等不起。
此前 DeepSeek V4 的延期发布就证明了这点。
最近蒸馏事件又闹得沸沸扬扬,无论真假如何,还是暴露同一个问题,那就是:算力不足。
纵使中国模型团队能搭出 DSA+MLA+GRPO 、KDA+AttnRes 这样的架构,能能在 KV 缓存压缩和强化学习目标函数上做出世界级的数学洞察,但架构创新解决的是用更少的卡跑出更好的结果,解决不了没有足够的卡去跑足够的次数,不得不外采精英轨迹。
天才的洞见撞上现实的墙,总体上太平洋两岸在半导体、AI 的技术、人才、算力差距客观上是巨大的,也正因为如此,国产模型、芯片从业者非常不容易,差距缩小是建立在极小概率的天才闪光、极苛刻的工程约束、极艰难的路线选择之上,那不是常态。
把差距缩小当成常态,就低估了从业者们有多不容易,把进步当成理所当然,就会忘了这种追赶本身有多么脆弱,它依赖的不仅是努力,还有运气,而运气,不会永远都在。
目前,中国模型厂,基本是走 API 低价路线的:便宜 - 毛利撑不起轨迹矿和验证器生态 - 造不出精英训练信号 - 能力只能在旧赛道收敛。而美国前沿的循环相反:贵 - Claude Code/Codex 向精英收费、精英生产高质量轨迹 - 信号回炉 - 更强 - 支撑更高生产力溢价 - 更强一代模型。
要打破国产模型自我削弱的闭环,就必须建立起模型 — 应用 — 信号的正循环,研发下代大参数高性能模型,通过应用获得人类专家标注,有算力去跑 RL 自我对弈,把精英轨迹回炉成下一代模型的燃料。
所以,在等待国产算力上量的同时,卡模应该分开走,齐头并进。
Blackwell 是买不到,那么可以看情况放开引进 H200 ,让模型厂补充训练算力缺口,腾出更多国产算力用于推理,并探索预训练、后训练、推理的国产算力适配。H200 的供给是有可能的、生态是成熟的(CUDA、NCCL、整个训练栈零迁移成本),DeepSeek 现有的 2 万张 H 集群、其他模型厂的算力集群可以直接扩容。对模型厂而言,这是唯一 “今天下单、下个月训练” 的选项。
乌兰察布的国产卡跑推理,英伟达卡跑训练产能,两者不是对立关系,是分工关系,本质是用现成的算力把下一回合的入场券先攥在手里,给国产芯片争取那 18 到 24 个月的爬坡时间,期间的国产适配尝试正好积累经验。等国产芯片产能到位的那天,模型厂手里既有迭代了下一代模型,也有在乌兰察布上跑出来的国产推理经验,才是真正全栈全量国产化的时候。
不然等国产产能到位再补训练,等于把国产模型的能力基线冻结。因为算力不够,就不是预训练能不能完成、版本能不能快速迭代的问题,是整个架构大概率只能继续往极致压缩上加点,再有数学洞见也只能往效率里挖,产不出更多精英轨迹反哺后训练,后训练缺算力又缺飞轮,没法往能力上追。
这道新高墙不是再用数学 / 应用数学的新洞见搭起新架构就能翻过去的,从等效能力的维度,就不是 “还差多久” 的问题。
目前国产模型的护城河、调用份额,很大程度上建立在同等智能、开源、更低价格上,如果美国模型厂在用最前沿模型占据了能力赛道的同时,继续调低次级模型的价格,那么国产模型赖以生存的性价比优势就不再是绝对优势。2026 年夏天已经出现了这个苗头,GPT-5.6 Luna 输入价格降幅 80%,Anthropic 以半价推出 Claude Opus 5。
国产模型性价比的护城河,正在被美国厂商用降价战术一点点侵蚀。侵蚀的速度,不仅取决于美国模型的迭代速度,还取决于国产模型能不能在窗口期内把能力边界推上去。如果推不上去,国产模型就会被双向挤压。
要不要补充 H200 不仅是技术问题,更是一个还要不要留在牌桌上的战略问题。它当然不是解药,只是止痛药,它补得了窗口期内的训练缺口,补不了代际差距,更补不了国产训练栈从万卡到十万卡的工程能力。谁也不指望买 20 万颗上一代产品就追平 Blackwell 集群,但这样做的意义,是以时间换空间。
AI 是大国博弈的关键,必须得赢,那么确实是要进一步完善算力基础设施,构建多层次网络化算力体系。能否采购到 H200 不只是模型厂的采购决策,放到全国一体化算力网的框架里看,其实是算力底座分层布局的一个节点,算力底座的统筹布局是为更前沿模型铺路的。
毕竟,谁都不想再经历一次 2025 年 2 月前那种全面被碾压的悲观情绪。
来源:翔哥有话要说