Appearance
共 77 篇文章
平头哥发布首款智能网卡磐脉920,最大支持400Gbps吞吐带宽,面向万卡级AI智算集群。产品已量产并率先部署阿里云数据中心,目标是提升AI集群系统效率,补齐算力系统最后一块短板。
2026年5月7日,英伟达重新思考AI基础设施经济效益评估标准,强调每Token成本才是唯一重要指标,Blackwell平台每Token成本比Hopper降低35倍,每瓦Token产出提升50倍,标志着AI基础设施评估从传统算力指标转向实际产出指标。
无问芯穹再获超7亿元融资。平台上线160+大模型,日均Token调用量较去年底增长20倍。CEO夏立雪提出AI生产力公式,AGI基础设施是Token经济「炼化厂」。
苹果2026年Q1研发支出占营收比例达10.3%,30年来首次突破10%。研发增速34%是营收增速17%的两倍。库克2026年9月交棒前,AI投资正在追赶谷歌、微软、Meta、亚马逊四巨头。
OpenAI联合5大芯片巨头发布MRC网络协议,通过OCP开源。该协议将AI超算故障恢复时间从秒级缩至微秒级,两层交换机连接13万GPU,解决大规模训练的网络瓶颈问题。
AI Infra企业无问芯穹再获超7亿元融资,Agentic MaaS平台日均Token调用量增长超20倍。公司提出AI生产力公式,正成为中国Token经济的核心枢纽。
马斯克将xAI的Colossus 1超算集群22万张GPU全量供给Claude,Claude付费用户5小时限额翻倍。SpaceXAI、Anthropic、OpenAI三方冲刺IPO,算力争夺战升级。
平头哥发布首款智能网卡「磐脉 920」,国内首个内置PCIe Switch的400G网卡,可将大模型训练和推理任务完成时间缩短14%,已量产部署阿里云。
马斯克建立的AI算力集群拥有55万块英伟达GPU,但实际利用率仅11%。这引发行业讨论:是算力过剩还是超前布局?
AWS推出SageMaker AI容量感知推理,自动在多实例类型间回退,确保AI推理服务零停机。这意味着AI部署不用再为GPU缺货头疼,云算力管理进入自动化时代。
AWS让QuickSight可直接查询S3中的Apache Iceberg表,跳过传统数据仓库中间层。AI应用的数据架构成本可能大幅下降,数据分析直接建立在S3上成为可能。
xAI手握55万颗英伟达GPU,但模型浮点运算利用率仅11%,远低于Meta/谷歌的40%+。问题不在硬件,在软件栈优化。xAI总裁承认目标数月内提升至50%。
NVIDIA展示用多Agent squad改造地下工程仿真流程的架构。编排Agent协调、仿真Agent执行、工作流Agent管理,工程师从监控者变成战略决策者,实现7×24无人值守仿真。
智谱公开GLM-5在高并发Coding Agent场景下踩的坑。线下无法复现、线上持续出现的问题,根因是KV Cache竞态条件。智谱给出在线监控策略:spec_accept_length<1.4时主动中止。
度小满金融将数据存储引擎从Eggroll迁移到OceanBase时重建入库架构。K8s弹性架构替代单机脚本,吞吐从400万条/秒提升到800万条/秒,峰值1000万条/秒。核心教训:换数据库不是换个数据库写。
「算电协同」联合体正式成立,首批20余家成员单位,旨在解决AI算力爆发与绿色低碳发展的矛盾。太初元碁PUE 1.1的液冷方案成为标杆,AI算力中心的能耗黑洞正在被填平。
Akamai CEO指出AI Agent时代云计算正从中心化走向分布式边缘。Agent工作流50步累积延迟可致任务失败。数据主权、成本压力、合规需求三重驱动力,边缘计算获得新生命。
Mistral AI发布Workflows企业AI工作流编排层,基于Temporal构建,核心解决Agent结果仅部分正确时的合规治理难题。引入审批检查点,可在不消耗计算资源时暂停,等待人工输入。
Slack工程师披露长时运行多Agent系统的上下文管理方案。不是累积聊天记录,而是用Director日志+Critic评审+Critic时间线三种互补通道管理上下文,跨越数百次请求仍保持连贯性。
NVIDIA展示用Agentic AI改造地下工程仿真流程:标准24小时turnaround变成多天延迟。Agentic AI让工程师从操作者变为监督者,模拟任务7×24小时无人值守自动运行。
Netflix在Tech Blog披露直播技术架构:面对1.08亿观众同时观看,AI自动化不够用,必须建立"人类基础设施"作为最后防线。AI处理常规场景,人类介入边缘故障——这是大规模直播的正确解法。
Cloudflare推出Agent Memory,解决AI智能体长时间运行后的上下文衰减问题。通过结构化记忆提取、5通道RRF并行检索,让模型在更少但更相关的内容下输出更优质结果。
CNCF博文指出K8s能保证LLM Pod运行正常,但无法控制AI行为是否安全。当LLM放在日志/API/凭据之前时,引入了可被提示词影响的新抽象层,传统安全控制管不了这个。
Red Hat推出Tank OS开源项目,用容器化+rootless架构为AI Agent打造隔离运行环境,防止权限滥用导致数据泄露或系统破坏。基于Fedora Linux,支持多实例隔离。
Anthropic有意将英国芯片初创Fractile作为NVIDIA、Trainium、TPU外的第四类算力,2027年部署目标。Fractile采用"模拟内存计算"架构,声称25倍速度、1/10成本。
InfoQ详解分层Agentic RAG架构,用Supervisor-Worker拓扑解决企业结构化和非结构化数据的协同难题。评估显示静默失败率从30%大幅降低。
NVIDIA CEO黄仁勋确认,公司在中国AI加速器市场份额已降至0%,出口管制"产生反效果"。中国正用本土硬件替代,CUDA护城河成最后防线。
Google在Q1财报确认向部分客户交付TPU硬件,TPU 8t处理能力是上代3倍,TPU 8i价格性能提升80%,Google Cloud Q1首超200亿美元+63%。详见全文。
谷歌Gemini应用新增文件生成功能,支持直接在对话中创建PDF、Word、Excel、Google Docs等文件,全球用户已开放,实现从头脑风暴到完整文件的一站式流程。
Cloudflare 推出 Agent Memory 私人测试版,解决 AI 智能体「上下文衰减」问题。引入 Llama 4 Scout 17B 提取、Nemotron 3 120B 合成的双通道架构,以结构化记忆替代塞满上下文的方式。
Altman之前批评Anthropic限制Mythos是恐惧营销,现在OpenAI确认对Cyber工具也做同样的事:限制访问,只向验证的网络防御者开放。
华为小艺Claw正式接入DeepSeek V4,上线自进化能力,支持百万级超长上下文,成为首个获国家级认证的终端厂商AI智能体。
美光CEO表示,AI对DRAM和NAND的需求将超过市场总规模50%。随着推理端迎来拐点,更高速更大容量的存储已成为支撑AI的战略资产。
Akamai CEO谈Agent时代:AI代理兴起驱动云架构从「中心化」转向「分布式推理」。50个步骤累积100ms延迟将导致任务失败。AI安全威胁比以往更必要。
Netflix直播翻车AI也救不了。1.08亿观众同时观看拳击赛,Netflix建立"人类基础设施"应对直播不确定性。标准算法在面对特殊故障时缺乏足够上下文。
Dropbox工程师透露,大型基础设施改动也是"先上线再说,看看哪儿炸"。这与大公司"改完系统先上线"的实践形成呼应,引发工程师社区讨论。
英伟达CEO黄仁勋承认,公司在中国AI加速器市场份额已降至0%。他直言放弃中国市场"在战略上恐怕并不合理",出口管制产生了反效果。
Cloudflare推出Code Mode MCP服务器,将2500个API端点的Token占用从117万降至1000Token,降幅99.9%。通过TypeScript API让AI直接编写代码。
InfoQ报道分层Agentic RAG系统方案(Protocol-H),解决结构化数据与非结构化文档同时查询的"模态鸿沟"问题。Supervisor-worker拓扑加反射重试实现自主纠错,Q4 2025测试中30%传统RAG存在静默失败。
AWS发布AgentCore Memory命名空间设计指南,详解三种检索API(语义检索、枚举检索、直接查询)和四种记忆策略(语义/偏好/情景/反思)。命名空间类似DynamoDB分区键。
InfoQ观察:DeepSeek V4让私有化部署接近闭源旗舰后,企业AI编程的真正障碍浮出水面——不是模型能力,是代码库的业务隐知识。95%企业没从AI投资获得有意义回报,原因不是模型不行。
AWS发布LLM-as-a-judge奖励函数设计指南,对比两种评估模式(布尔评分vs偏好评分),指出布尔评分更可靠。生产级RFT系统每次训练步处理数千次奖励评估,需配合确定性奖励组件。
Slack工程师公开多智能体上下文管理方案:采用三类互补上下文通道(Director日志、Critic评审、Critic时间线)维持长时运行Agent的连贯性与准确性,避免上下文窗口被消息历史填满。
AWS发布Model Agility Solution,提供从源模型到目标模型迁移的完整指南。三步流程:评估、迁移、优化。两款提示词迁移工具Amazon Bedrock Prompt Optimization和Anthropic Metaprompt,后者由Claude自动生成优化提示词模板。
InfoQ深度技术文章:分层Agentic RAG解决企业「模态鸿沟」,让结构化和非结构化数据同时被理解。内部评估显示30%传统RAG存在静默失败。Protocol-H引入supervisor-worker拓扑和自主纠错机制。
Mistral AI推出企业AI编排工具Workflows,基于Temporal构建,支持有状态执行、人机协同步骤和全程可观测性。解决AI生产部署中"流水线在开发环境正常、生产环境就挂"的常见痛点。
Alphabet确认谷歌将向部分客户交付TPU硬件设备,TPU 8t训练能力是上代Ironwood的3倍,TPU 8i推理性能是其2倍、价格性能比提升80%。Google Cloud Q1营收首超200亿美元,同比增63%,GenAI产品收入增长近80%。
OpenAI官方博客详细揭秘"小妖精"现象的成因:Nerdy人格的高奖励信号导致模型学会用goblin/gremlin等词。3月取消Nerdy后,GPT-5.5的goblin提及量却不降反升。RL训练让行为从单一条件扩散到所有场景。
AWS官方博客详细讲解了LLM-as-a-judge方法:用大模型评价其他模型输出,作为RLHF的奖励信号。介绍了Rubric-based和Preference-based两种评价模式,以及如何设计有效的评价提示词。
Anthropic用Claude Code在Linux内核中发现5个漏洞,包括一个自2003年就存在的NFS溢出。8个月前Opus 4.1几乎挖不到,现在Opus 4.6已能系统性发现。内核维护者报告从每周2-3条升到每天5-10条。
英伟达在官方博客展示了用多Agent系统做油气藏仿真优化的方案。AI Agent 24/7无缝接力仿真流程,将原本需要数天的周期压缩到连续运转,工程师转型为"战略监督"角色。
AWS Interconnect正式发布,提供AWS与Google Cloud之间的托管私有连接,三大超大规模云厂商首次实现联合设计的跨云互连。资源配置从数周压缩到几分钟。
Counterpoint预测联发科2028年将交付500万颗谷歌TPU芯片,以26%市占成为AI ASIC设计服务领域仅次于博通的参与者。联发科从手机芯片切入AI基础设施,与谷歌深度绑定。
SEMI报告2026年Q1全球硅晶圆出货面积3275百万平方英寸,同比+13.1%。AI数据中心需求从先进逻辑芯片扩散到电源管理组件,整个半导体产业链都在受益。