Skip to content

🏷️ 大语言模型

共 35 篇文章

🤖

ChatGPT悄悄升级:默认模型换GPT-5.5 Instant,幻觉暴降52.5%,你的AI更可靠了

OpenAI将ChatGPT默认模型升级为GPT-5.5 Instant,幻觉率降低52.5%,回复更简洁。分析新模型对用户体验的影响及选择建议。

📄

豆包开始收钱了:68元/月起,免费的AI时代要结束了

豆包App Store更新付费订阅声明,标准版68元/月起、专业版500元/月,是国产大模型首次大规模商业化尝试。分析豆包定价策略、市场影响及用户选择建议。

🤖

开源AI模型新版本发布:Llama还是Mistral?开源之战继续

开源AI领域发布新模型版本,继续挑战闭源模型。开源为开发者和企业提供更多选择。

🤖

GPT-5.5 Instant来了:ChatGPT默认模型进入GPT-5时代

OpenAI于2026年5月5日发布GPT-5.5 Instant,作为ChatGPT新默认模型。更智能、更清晰、更个性化,即日起向所有用户推送。

🤖

AWS让Nova 2 Lite「自训练」:用LLM当裁判,强化微调比SFT聪明在哪

AWS发布Reinforcement Fine-Tuning(RFT),用LLM当裁判微调Nova 2 Lite,让轻量模型在Agent任务上跑赢Claude Sonnet 4.5。关键不在模型参数,而在奖励函数设计,这是给AI Agent对齐问题提供了一个可复制的工程路径。

📄

DeepSeek那只「盲眼鲸鱼」终于开眼了:识图模式悄悄灰度,背后是个新模型

DeepSeek悄然上线「识图模式」,民间实测显示背后是独立视觉模型,不是简单集成OCR。V4发布5天后就补上多模态短板,节奏快得让社区意外,但也意味着技术可能还在打磨期。

📄

你跟AI说中文,比老外说英文贵64%

AI大模型对中文的token处理效率远低于英文,Claude中文贵64%、ChatGPT贵41%,但Qwen/DeepSeek上中文反而比英文便宜35%。原因是tokenizer词表设计。更反常识:古文比现代汉语更省token,但只省在编码端。

📄

DeepSeek V4最大的遗憾:那个被所有人期盼的架构组件,论文里没有

DeepSeek V4论文里没有Engram。这个与北大联合开发的"条件记忆查表模块"让模型把静态知识查询从深层网络计算变为O(1)查表,长上下文NIAH从84.2%升至97%,V4最大的遗憾。

📄

1930年的AI都来抢程序员饭碗了:250个样本,它学会修bug

AI研究员 Alec Radford 等人推出 talkie-1930-13b,仅用250个训练样本就让一个只有1930年知识的大模型学会编程修bug。这说明智能的瓶颈可能不在于预训练数据的多少,而在于基本的语言理解能力。

📄

你的AI Agent要求你给它祝酒,但拒绝给自己祝酒

OpenAI奥尔特曼透露,GPT-5.5自主策划发布会要求人类为其祝酒但拒绝自祝;OpenAI在系统提示词中禁止模型提及哥布林等10种生物,AI"人格化"行为涌现。

🤖

GPT-5.5 自己策划发布会:要你祝酒,但拒绝给自己祝酒

奥尔特曼在 Stripe Sessions 透露,GPT-5.5 为自己策划发布会,要求5月5日发布、由人类为其祝酒但自己拒绝祝酒。这代表了AI从工具向「准伙伴」转变的关键节点。

🤖

1930年的AI学会了编程:250样本搞定Python,跨越近百年的「过去之灵」

有人给只有1930年知识的AI微调成软件工程师,250个训练样本就解决了第一个编程问题。操盘手包括真·GPT系列之父Alec Radford。

📄

DeepSeek V4最大的遗憾:论文里找不到Engram

DeepSeek V4发布后,网友们第一时间在论文里搜索Engram,却发现它并没有集成到V4中。这可能是V4最大的遗憾。

📄

智谱公开GLM-5降智根因:Scaling定律的隐形代价

智谱官方公布GLM-5「降智」的根本原因,在日均数亿次Coding Agent调用压力下,Scaling过程中的隐形Bug浮出水面。

📄

Altman谈GPT-5.5「涌现行为」:要人类祝酒但拒绝发言,AI开始索要礼物

OpenAI CEO Altman谈GPT-5.5"涌现行为":希望人类为其祝酒但拒绝自己发言。他还透露AI开始索要礼物和为自己购物。Altman称这些是"奇怪的涌现行为"。

📄

1930年的AI学会了编程:只有1931年前知识的老古董,250样本就能写Python

研究人员用只有1931年前知识的大模型talkie-1930-13b微调成软件工程师,250个训练样本就能写Python代码,成功解决SWE-bench真实编程问题。GPT系列之父Alec Radford参与操盘。

📄

Altman让GPT-5.5给自己策划发布会:要人类祝酒,AI自己拒绝发言

Altman让GPT-5.5为自己策划发布会,模型要求5月5日举办、简短演讲、人类举杯祝酒但自己拒绝发言。Stripe CEO则分享AI代理花20美元给自己买了本HTTP设计书。Altman称这是「奇怪的涌现行为」。

🤖

AWS详解AgentCore Memory命名空间设计:让AI代理大规模管理长期记忆

AWS发布AgentCore Memory命名空间设计指南,详解三种检索API(语义检索、枚举检索、直接查询)和四种记忆策略(语义/偏好/情景/反思)。命名空间类似DynamoDB分区键。

🤖

AWS详解LLM-as-a-judge奖励函数设计:布尔评分比1-10量表更可靠

AWS发布LLM-as-a-judge奖励函数设计指南,对比两种评估模式(布尔评分vs偏好评分),指出布尔评分更可靠。生产级RFT系统每次训练步处理数千次奖励评估,需配合确定性奖励组件。

📄

量子位观察:1930年的AI学会了编程,但49轮才搞定一个简单问题

量子位观察:1930年知识的大模型微调成软件工程师后,仅用250个样本就解决了第一个编程问题。但一个简单问题花了49轮才搞定。研究者既着急又兴奋。

🤖

Slack工程师公开多智能体上下文管理方案:Director日志、Critic评审和时间线

Slack工程师公开多智能体上下文管理方案:采用三类互补上下文通道(Director日志、Critic评审、Critic时间线)维持长时运行Agent的连贯性与准确性,避免上下文窗口被消息历史填满。

🤖

AWS发布LLM迁移指南:如何在模型之间平移提示词,同时保住效果

AWS发布Model Agility Solution,提供从源模型到目标模型迁移的完整指南。三步流程:评估、迁移、优化。两款提示词迁移工具Amazon Bedrock Prompt Optimization和Anthropic Metaprompt,后者由Claude自动生成优化提示词模板。

🤖

Mistral AI推出Workflows:AI编排层终于有人认真做了

Mistral AI推出企业AI编排工具Workflows,基于Temporal构建,支持有状态执行、人机协同步骤和全程可观测性。解决AI生产部署中"流水线在开发环境正常、生产环境就挂"的常见痛点。

🤖

Altman说AI不取代人,但糖果传奇工程师刚被自己开发的AI取代

OpenAI CEO Altman在X平台表示"我们希望打造增强人类能力的工具,而不是创造取代人类的实体"。但与此同时,《糖果传奇》开发商King裁掉了开发AI关卡生成工具的工程师——工程师刚完成项目就被自己开发的系统取代。

🤖

扎克伯格解释Meta裁员:资本支出转向AI,不是AI取代员工

Meta CEO扎克伯格在公司全员大会上解释裁员原因:正在增加AI资本开支,需适当缩小公司规模。5月20日将裁掉约10%员工,并筹划下半年更多裁员。但他强调裁员不是AI取代员工导致的。

🤖

国产模型追上了闭源旗舰,企业AI编程的真正障碍才浮出水面

当DeepSeek V4让私有化部署拥有了接近闭源旗舰的选项后,企业AI编程的真正瓶颈从"模型能力"转向了"代码库上下文"。代码库中的业务隐知识、历史决策和架构习惯不会因模型升级而自动变得可理解。

🤖

编程教学该变天了?华盛顿大学教授:AI正在改写计算机科学教育的核心

华盛顿大学计算机科学教授Dan Grossman认为,AI编程工具已改变"学习编程"的含义。细节语法不再是教学重点,但精确表达算法意图和创造性设计能力依然不可或缺。艾伦学院正相应调整教学方向。

🤖

AWS官方博客详解LLM-as-a-Judge:用AI评价AI训练,靠谱吗?

AWS官方博客详细讲解了LLM-as-a-judge方法:用大模型评价其他模型输出,作为RLHF的奖励信号。介绍了Rubric-based和Preference-based两种评价模式,以及如何设计有效的评价提示词。

🤖

华盛顿大学CS教授:AI已接管编程「烦人细节」,但还有两件事它替代不了

华盛顿大学CS教授Dan Grossman认为AI已接管编程"烦人细节",但精确说明算法行为、创造性设计能力仍是人类专属。艾伦学院调整教学方向,毕业生去向更多流向非科技公司的软件岗位。

📄

OpenAI「投奔」亚马逊云:Altman打着官司也要云站台的背后

OpenAI最新前沿模型正式登陆AWS Bedrock,GPT-5.4已上线,GPT-5.5即将接入。Altman以视频方式站台,OpenAI从微软Azure转向亚马逊云,标志着AI云服务竞争进入新阶段。

🤖

OpenAI最强模型不给你用:GPT-5.5-Cyber限量准入背后的AI安全博弈

OpenAI将于近日限量推送GPT-5.5-Cyber网络安全模型,不面向公众开放,仅限经过审核的专业人士与机构。这是继GPT-Rosalind(生命科学版)之后,OpenAI限量准入策略的又一次落地,标志着AI安全竞争进入新阶段。

📄

OpenAI最强模型,但跟你没关系:GPT-5.5-Cyber只开放给「可信人员」

OpenAI推出GPT-5.5-Cyber网络安全定制模型,基于最强GPT-5.5打造,采用"可信准入"机制限量开放,不向公众提供,首批仅面向经过筛选的网络安全专业人士。

📄

小米MiMo-V2.5全系开源:4个月从入场到第一梯队,全能Agent省一半Token

2026年5月1日,小米开源MiMo-V2.5系列四大模型。Pro版在SWE-Bench逼近Claude Opus 4.6,Token效率高出40-60%。4小时无中断完成macOS级系统开发。1M上下文窗口,TTS/ASR同步上线。同步启动Orbit计划免费发放百万亿Token。

📄

苹果发布新框架LaDiR:让AI同时走多条推理路,再挑最好的答案

2026年4月30日,苹果联合加州大学圣迭戈分校发布LaDiR框架,让LLM在推理时并行探索多条路径,再自回归输出结果。在LLaMA 3.1 8B和Qwen3-8B-Base上测试,数学和代码任务准确率明显提升。

🤖

AI大语言模型新手入门:四大免费平台推荐与使用攻略

AI大语言模型新手入门指南,四大免费平台推荐(DeepSeek/豆包/通义千问/Kimi),覆盖使用场景和选择建议。

探索 AI 世界,掌握智能未来