Skip to content

🏷️ AI基础设施

共 77 篇文章

📄

平头哥磐脉920:补齐AI算力最后一块短板,万卡集群不再「堵车」

平头哥发布首款智能网卡磐脉920,最大支持400Gbps吞吐带宽,面向万卡级AI智算集群。产品已量产并率先部署阿里云数据中心,目标是提升AI集群系统效率,补齐算力系统最后一块短板。

📄

英伟达重新定义AI成本:每Token成本才是唯一重要指标

2026年5月7日,英伟达重新思考AI基础设施经济效益评估标准,强调每Token成本才是唯一重要指标,Blackwell平台每Token成本比Hopper降低35倍,每瓦Token产出提升50倍,标志着AI基础设施评估从传统算力指标转向实际产出指标。

📄

无问芯穹再获7亿元融资:日均Token调用量半年涨20倍,AGI基础设施比大模型更稀缺

无问芯穹再获超7亿元融资。平台上线160+大模型,日均Token调用量较去年底增长20倍。CEO夏立雪提出AI生产力公式,AGI基础设施是Token经济「炼化厂」。

📄

苹果研发支出占比30年来首超10%:AI时代终于开始「认真」了

苹果2026年Q1研发支出占营收比例达10.3%,30年来首次突破10%。研发增速34%是营收增速17%的两倍。库克2026年9月交棒前,AI投资正在追赶谷歌、微软、Meta、亚马逊四巨头。

🤖

OpenAI发布MRC协议:联手英伟达/AMD/博通/英特尔/微软,重塑AI超算网络架构

OpenAI联合5大芯片巨头发布MRC网络协议,通过OCP开源。该协议将AI超算故障恢复时间从秒级缩至微秒级,两层交换机连接13万GPU,解决大规模训练的网络瓶颈问题。

📄

无问芯穹再获超7亿元融资:AI算力调度平台日均Token调用量增长20倍

AI Infra企业无问芯穹再获超7亿元融资,Agentic MaaS平台日均Token调用量增长超20倍。公司提出AI生产力公式,正成为中国Token经济的核心枢纽。

📄

马斯克22万张GPU全给Claude用:Colossus 1算力大单背后的三方博弈

马斯克将xAI的Colossus 1超算集群22万张GPU全量供给Claude,Claude付费用户5小时限额翻倍。SpaceXAI、Anthropic、OpenAI三方冲刺IPO,算力争夺战升级。

📄

平头哥发布首款智能网卡磐脉920:国内首个400G网卡,补齐AI算力最后一环

平头哥发布首款智能网卡「磐脉 920」,国内首个内置PCIe Switch的400G网卡,可将大模型训练和推理任务完成时间缩短14%,已量产部署阿里云。

📄

马斯克55万GPU集群,利用率只有11%:算力过剩还是布局超前?

马斯克建立的AI算力集群拥有55万块英伟达GPU,但实际利用率仅11%。这引发行业讨论:是算力过剩还是超前布局?

📄

AWS让SageMaker学会见风使舵:AI推理不用再为GPU缺货头疼

AWS推出SageMaker AI容量感知推理,自动在多实例类型间回退,确保AI推理服务零停机。这意味着AI部署不用再为GPU缺货头疼,云算力管理进入自动化时代。

📄

AWS用S3直接做AI分析:数据仓库的中间层,正在被革命

AWS让QuickSight可直接查询S3中的Apache Iceberg表,跳过传统数据仓库中间层。AI应用的数据架构成本可能大幅下降,数据分析直接建立在S3上成为可能。

🤖

马斯克55万GPU只跑出11%利用率:硬件堆赢了,软件拖了后腿

xAI手握55万颗英伟达GPU,但模型浮点运算利用率仅11%,远低于Meta/谷歌的40%+。问题不在硬件,在软件栈优化。xAI总裁承认目标数月内提升至50%。

🤖

工程师下班后仿真还在跑,NVIDIA用多Agent squad把它变成7×24无人值守

NVIDIA展示用多Agent squad改造地下工程仿真流程的架构。编排Agent协调、仿真Agent执行、工作流Agent管理,工程师从监控者变成战略决策者,实现7×24无人值守仿真。

🤖

智谱公布「降智」的真相:Scaling绕不开的隐形坑,高并发推理的竞态条件

智谱公开GLM-5在高并发Coding Agent场景下踩的坑。线下无法复现、线上持续出现的问题,根因是KV Cache竞态条件。智谱给出在线监控策略:spec_accept_length<1.4时主动中止。

🤖

换数据库不是「换数据库」:度小满400亿条数据迁移背后的架构重构

度小满金融将数据存储引擎从Eggroll迁移到OceanBase时重建入库架构。K8s弹性架构替代单机脚本,吞吐从400万条/秒提升到800万条/秒,峰值1000万条/秒。核心教训:换数据库不是换个数据库写。

🤖

「算电协同」国家队落地:AI算力中心的能耗黑洞,有了出口

「算电协同」联合体正式成立,首批20余家成员单位,旨在解决AI算力爆发与绿色低碳发展的矛盾。太初元碁PUE 1.1的液冷方案成为标杆,AI算力中心的能耗黑洞正在被填平。

🤖

AI Agent时代,云计算正在从「集中」走向「分布式边缘」——延迟是硬约束

Akamai CEO指出AI Agent时代云计算正从中心化走向分布式边缘。Agent工作流50步累积延迟可致任务失败。数据主权、成本压力、合规需求三重驱动力,边缘计算获得新生命。

🤖

Mistral AI做工作流编排,但真正想解决的是「Agent结果不完美」时的合规问题

Mistral AI发布Workflows企业AI工作流编排层,基于Temporal构建,核心解决Agent结果仅部分正确时的合规治理难题。引入审批检查点,可在不消耗计算资源时暂停,等待人工输入。

🤖

Slack做多Agent系统踩过的坑:不塞更多上下文,而是更聪明地管理上下文

Slack工程师披露长时运行多Agent系统的上下文管理方案。不是累积聊天记录,而是用Director日志+Critic评审+Critic时间线三种互补通道管理上下文,跨越数百次请求仍保持连贯性。

🤖

地下仿真原本24小时出结果,NVIDIA用AI Agent把它变成7×24小时无人值守

NVIDIA展示用Agentic AI改造地下工程仿真流程:标准24小时turnaround变成多天延迟。Agentic AI让工程师从操作者变为监督者,模拟任务7×24小时无人值守自动运行。

🤖

Netflix直播1亿人观赛背后:AI能做的有限,剩下靠人

Netflix在Tech Blog披露直播技术架构:面对1.08亿观众同时观看,AI自动化不够用,必须建立"人类基础设施"作为最后防线。AI处理常规场景,人类介入边缘故障——这是大规模直播的正确解法。

🤖

为什么AI Agent跑久了会变笨?Cloudflare给出了答案

Cloudflare推出Agent Memory,解决AI智能体长时间运行后的上下文衰减问题。通过结构化记忆提取、5通道RRF并行检索,让模型在更少但更相关的内容下输出更优质结果。

🤖

K8s能保你LLM「活着」,但保不了它不出事:CNCF发出安全警告

CNCF博文指出K8s能保证LLM Pod运行正常,但无法控制AI行为是否安全。当LLM放在日志/API/凭据之前时,引入了可被提示词影响的新抽象层,传统安全控制管不了这个。

🤖

Red Hat做了个Tank OS,专门给AI Agent造的安全箱

Red Hat推出Tank OS开源项目,用容器化+rootless架构为AI Agent打造隔离运行环境,防止权限滥用导致数据泄露或系统破坏。基于Fedora Linux,支持多实例隔离。

🤖

Anthropic在找NVIDIA之外的第四类算力,英国初创声称能做到1/10成本

Anthropic有意将英国芯片初创Fractile作为NVIDIA、Trainium、TPU外的第四类算力,2027年部署目标。Fractile采用"模拟内存计算"架构,声称25倍速度、1/10成本。

🤖

企业RAG的「模态鸿沟」终于有解药了:多智能体分层编排实战

InfoQ详解分层Agentic RAG架构,用Supervisor-Worker拓扑解决企业结构化和非结构化数据的协同难题。评估显示静默失败率从30%大幅降低。

🤖

全球最强AI芯片公司,在中国市场的份额是0%

NVIDIA CEO黄仁勋确认,公司在中国AI加速器市场份额已降至0%,出口管制"产生反效果"。中国正用本土硬件替代,CUDA护城河成最后防线。

🤖

Google开始卖TPU硬件了,不只是卖算力

Google在Q1财报确认向部分客户交付TPU硬件,TPU 8t处理能力是上代3倍,TPU 8i价格性能提升80%,Google Cloud Q1首超200亿美元+63%。详见全文。

🤖

刚用AI写完报告就要切Word排版?Gemini说不用了

谷歌Gemini应用新增文件生成功能,支持直接在对话中创建PDF、Word、Excel、Google Docs等文件,全球用户已开放,实现从头脑风暴到完整文件的一站式流程。

📄

Cloudflare Agent Memory 上线:解决AI Agent「越用越笨」问题

Cloudflare 推出 Agent Memory 私人测试版,解决 AI 智能体「上下文衰减」问题。引入 Llama 4 Scout 17B 提取、Nemotron 3 120B 合成的双通道架构,以结构化记忆替代塞满上下文的方式。

🤖

Altman批评Anthropic限制安全工具,现在OpenAI对Cyber也这样做

Altman之前批评Anthropic限制Mythos是恐惧营销,现在OpenAI确认对Cyber工具也做同样的事:限制访问,只向验证的网络防御者开放。

🤖

华为小艺Claw接入DeepSeek V4:端侧AI与国产最强模型的协同

华为小艺Claw正式接入DeepSeek V4,上线自进化能力,支持百万级超长上下文,成为首个获国家级认证的终端厂商AI智能体。

🤖

美光CEO:AI对DRAM和NAND需求将超市场总规模50%

美光CEO表示,AI对DRAM和NAND的需求将超过市场总规模50%。随着推理端迎来拐点,更高速更大容量的存储已成为支撑AI的战略资产。

🤖

Akamai CEO:Agent时代云架构从「中心化」转向「分布式边缘」

Akamai CEO谈Agent时代:AI代理兴起驱动云架构从「中心化」转向「分布式推理」。50个步骤累积100ms延迟将导致任务失败。AI安全威胁比以往更必要。

🤖

Netflix直播翻车AI也救不了:1.08亿观众背后的「人类基础设施」

Netflix直播翻车AI也救不了。1.08亿观众同时观看拳击赛,Netflix建立"人类基础设施"应对直播不确定性。标准算法在面对特殊故障时缺乏足够上下文。

🤖

Dropbox大公司也这样:改了系统先上线,看看哪儿炸

Dropbox工程师透露,大型基础设施改动也是"先上线再说,看看哪儿炸"。这与大公司"改完系统先上线"的实践形成呼应,引发工程师社区讨论。

🤖

黄仁勋承认英伟达中国市场份额降至0%:出口管制产生反效果

英伟达CEO黄仁勋承认,公司在中国AI加速器市场份额已降至0%。他直言放弃中国市场"在战略上恐怕并不合理",出口管制产生了反效果。

🤖

Cloudflare Code Mode:2500个API端点Token降低99.9%

Cloudflare推出Code Mode MCP服务器,将2500个API端点的Token占用从117万降至1000Token,降幅99.9%。通过TypeScript API让AI直接编写代码。

🤖

分层Agentic RAG系统:解决企业「模态鸿沟」,让结构化和非结构化数据同时被理解

InfoQ报道分层Agentic RAG系统方案(Protocol-H),解决结构化数据与非结构化文档同时查询的"模态鸿沟"问题。Supervisor-worker拓扑加反射重试实现自主纠错,Q4 2025测试中30%传统RAG存在静默失败。

🤖

AWS详解AgentCore Memory命名空间设计:让AI代理大规模管理长期记忆

AWS发布AgentCore Memory命名空间设计指南,详解三种检索API(语义检索、枚举检索、直接查询)和四种记忆策略(语义/偏好/情景/反思)。命名空间类似DynamoDB分区键。

🤖

国产模型追上闭源旗舰后,企业AI编程的真正障碍才浮出水面

InfoQ观察:DeepSeek V4让私有化部署接近闭源旗舰后,企业AI编程的真正障碍浮出水面——不是模型能力,是代码库的业务隐知识。95%企业没从AI投资获得有意义回报,原因不是模型不行。

🤖

AWS详解LLM-as-a-judge奖励函数设计:布尔评分比1-10量表更可靠

AWS发布LLM-as-a-judge奖励函数设计指南,对比两种评估模式(布尔评分vs偏好评分),指出布尔评分更可靠。生产级RFT系统每次训练步处理数千次奖励评估,需配合确定性奖励组件。

🤖

Slack工程师公开多智能体上下文管理方案:Director日志、Critic评审和时间线

Slack工程师公开多智能体上下文管理方案:采用三类互补上下文通道(Director日志、Critic评审、Critic时间线)维持长时运行Agent的连贯性与准确性,避免上下文窗口被消息历史填满。

🤖

AWS发布LLM迁移指南:如何在模型之间平移提示词,同时保住效果

AWS发布Model Agility Solution,提供从源模型到目标模型迁移的完整指南。三步流程:评估、迁移、优化。两款提示词迁移工具Amazon Bedrock Prompt Optimization和Anthropic Metaprompt,后者由Claude自动生成优化提示词模板。

🤖

分层Agentic RAG解决企业「模态鸿沟」:30%传统RAG存在静默失败

InfoQ深度技术文章:分层Agentic RAG解决企业「模态鸿沟」,让结构化和非结构化数据同时被理解。内部评估显示30%传统RAG存在静默失败。Protocol-H引入supervisor-worker拓扑和自主纠错机制。

🤖

Mistral AI推出Workflows:AI编排层终于有人认真做了

Mistral AI推出企业AI编排工具Workflows,基于Temporal构建,支持有状态执行、人机协同步骤和全程可观测性。解决AI生产部署中"流水线在开发环境正常、生产环境就挂"的常见痛点。

🤖

Google Cloud首次破200亿美元季度营收,同时开始向客户交付TPU硬件

Alphabet确认谷歌将向部分客户交付TPU硬件设备,TPU 8t训练能力是上代Ironwood的3倍,TPU 8i推理性能是其2倍、价格性能比提升80%。Google Cloud Q1营收首超200亿美元,同比增63%,GenAI产品收入增长近80%。

🤖

OpenAI官方揭秘「小妖精」现象:Nerdy人格只是元凶,但取消后问题更严重了

OpenAI官方博客详细揭秘"小妖精"现象的成因:Nerdy人格的高奖励信号导致模型学会用goblin/gremlin等词。3月取消Nerdy后,GPT-5.5的goblin提及量却不降反升。RL训练让行为从单一条件扩散到所有场景。

🤖

AWS官方博客详解LLM-as-a-Judge:用AI评价AI训练,靠谱吗?

AWS官方博客详细讲解了LLM-as-a-judge方法:用大模型评价其他模型输出,作为RLHF的奖励信号。介绍了Rubric-based和Preference-based两种评价模式,以及如何设计有效的评价提示词。

🤖

Claude Code挖出Linux潜伏23年的漏洞:8个月前还挖不到,现在报告满天飞

Anthropic用Claude Code在Linux内核中发现5个漏洞,包括一个自2003年就存在的NFS溢出。8个月前Opus 4.1几乎挖不到,现在Opus 4.6已能系统性发现。内核维护者报告从每周2-3条升到每天5-10条。

🤖

英伟达用AI Agent替代油气工程师的重复工作:24小时仿真原来要跑多天,现在无缝接力

英伟达在官方博客展示了用多Agent系统做油气藏仿真优化的方案。AI Agent 24/7无缝接力仿真流程,将原本需要数天的周期压缩到连续运转,工程师转型为"战略监督"角色。

🤖

AWS与Google首次实现跨云直连:不用再折腾数周,一杯咖啡的时间搞定

AWS Interconnect正式发布,提供AWS与Google Cloud之间的托管私有连接,三大超大规模云厂商首次实现联合设计的跨云互连。资源配置从数周压缩到几分钟。

🤖

联发科2028年要交付500万颗谷歌TPU:AI ASIC格局要变天了

Counterpoint预测联发科2028年将交付500万颗谷歌TPU芯片,以26%市占成为AI ASIC设计服务领域仅次于博通的参与者。联发科从手机芯片切入AI基础设施,与谷歌深度绑定。

🤖

AI数据中心需求正在扩散:从GPU到整个半导体产业链

SEMI报告2026年Q1全球硅晶圆出货面积3275百万平方英寸,同比+13.1%。AI数据中心需求从先进逻辑芯片扩散到电源管理组件,整个半导体产业链都在受益。

77 篇文章,当前第 1/2

探索 AI 世界,掌握智能未来