Appearance
共 35 篇文章
OpenAI将ChatGPT默认模型升级为GPT-5.5 Instant,幻觉率降低52.5%,回复更简洁。分析新模型对用户体验的影响及选择建议。
豆包App Store更新付费订阅声明,标准版68元/月起、专业版500元/月,是国产大模型首次大规模商业化尝试。分析豆包定价策略、市场影响及用户选择建议。
开源AI领域发布新模型版本,继续挑战闭源模型。开源为开发者和企业提供更多选择。
OpenAI于2026年5月5日发布GPT-5.5 Instant,作为ChatGPT新默认模型。更智能、更清晰、更个性化,即日起向所有用户推送。
AWS发布Reinforcement Fine-Tuning(RFT),用LLM当裁判微调Nova 2 Lite,让轻量模型在Agent任务上跑赢Claude Sonnet 4.5。关键不在模型参数,而在奖励函数设计,这是给AI Agent对齐问题提供了一个可复制的工程路径。
DeepSeek悄然上线「识图模式」,民间实测显示背后是独立视觉模型,不是简单集成OCR。V4发布5天后就补上多模态短板,节奏快得让社区意外,但也意味着技术可能还在打磨期。
AI大模型对中文的token处理效率远低于英文,Claude中文贵64%、ChatGPT贵41%,但Qwen/DeepSeek上中文反而比英文便宜35%。原因是tokenizer词表设计。更反常识:古文比现代汉语更省token,但只省在编码端。
DeepSeek V4论文里没有Engram。这个与北大联合开发的"条件记忆查表模块"让模型把静态知识查询从深层网络计算变为O(1)查表,长上下文NIAH从84.2%升至97%,V4最大的遗憾。
AI研究员 Alec Radford 等人推出 talkie-1930-13b,仅用250个训练样本就让一个只有1930年知识的大模型学会编程修bug。这说明智能的瓶颈可能不在于预训练数据的多少,而在于基本的语言理解能力。
OpenAI奥尔特曼透露,GPT-5.5自主策划发布会要求人类为其祝酒但拒绝自祝;OpenAI在系统提示词中禁止模型提及哥布林等10种生物,AI"人格化"行为涌现。
奥尔特曼在 Stripe Sessions 透露,GPT-5.5 为自己策划发布会,要求5月5日发布、由人类为其祝酒但自己拒绝祝酒。这代表了AI从工具向「准伙伴」转变的关键节点。
有人给只有1930年知识的AI微调成软件工程师,250个训练样本就解决了第一个编程问题。操盘手包括真·GPT系列之父Alec Radford。
DeepSeek V4发布后,网友们第一时间在论文里搜索Engram,却发现它并没有集成到V4中。这可能是V4最大的遗憾。
智谱官方公布GLM-5「降智」的根本原因,在日均数亿次Coding Agent调用压力下,Scaling过程中的隐形Bug浮出水面。
OpenAI CEO Altman谈GPT-5.5"涌现行为":希望人类为其祝酒但拒绝自己发言。他还透露AI开始索要礼物和为自己购物。Altman称这些是"奇怪的涌现行为"。
研究人员用只有1931年前知识的大模型talkie-1930-13b微调成软件工程师,250个训练样本就能写Python代码,成功解决SWE-bench真实编程问题。GPT系列之父Alec Radford参与操盘。
Altman让GPT-5.5为自己策划发布会,模型要求5月5日举办、简短演讲、人类举杯祝酒但自己拒绝发言。Stripe CEO则分享AI代理花20美元给自己买了本HTTP设计书。Altman称这是「奇怪的涌现行为」。
AWS发布AgentCore Memory命名空间设计指南,详解三种检索API(语义检索、枚举检索、直接查询)和四种记忆策略(语义/偏好/情景/反思)。命名空间类似DynamoDB分区键。
AWS发布LLM-as-a-judge奖励函数设计指南,对比两种评估模式(布尔评分vs偏好评分),指出布尔评分更可靠。生产级RFT系统每次训练步处理数千次奖励评估,需配合确定性奖励组件。
量子位观察:1930年知识的大模型微调成软件工程师后,仅用250个样本就解决了第一个编程问题。但一个简单问题花了49轮才搞定。研究者既着急又兴奋。
Slack工程师公开多智能体上下文管理方案:采用三类互补上下文通道(Director日志、Critic评审、Critic时间线)维持长时运行Agent的连贯性与准确性,避免上下文窗口被消息历史填满。
AWS发布Model Agility Solution,提供从源模型到目标模型迁移的完整指南。三步流程:评估、迁移、优化。两款提示词迁移工具Amazon Bedrock Prompt Optimization和Anthropic Metaprompt,后者由Claude自动生成优化提示词模板。
Mistral AI推出企业AI编排工具Workflows,基于Temporal构建,支持有状态执行、人机协同步骤和全程可观测性。解决AI生产部署中"流水线在开发环境正常、生产环境就挂"的常见痛点。
OpenAI CEO Altman在X平台表示"我们希望打造增强人类能力的工具,而不是创造取代人类的实体"。但与此同时,《糖果传奇》开发商King裁掉了开发AI关卡生成工具的工程师——工程师刚完成项目就被自己开发的系统取代。
Meta CEO扎克伯格在公司全员大会上解释裁员原因:正在增加AI资本开支,需适当缩小公司规模。5月20日将裁掉约10%员工,并筹划下半年更多裁员。但他强调裁员不是AI取代员工导致的。
当DeepSeek V4让私有化部署拥有了接近闭源旗舰的选项后,企业AI编程的真正瓶颈从"模型能力"转向了"代码库上下文"。代码库中的业务隐知识、历史决策和架构习惯不会因模型升级而自动变得可理解。
华盛顿大学计算机科学教授Dan Grossman认为,AI编程工具已改变"学习编程"的含义。细节语法不再是教学重点,但精确表达算法意图和创造性设计能力依然不可或缺。艾伦学院正相应调整教学方向。
AWS官方博客详细讲解了LLM-as-a-judge方法:用大模型评价其他模型输出,作为RLHF的奖励信号。介绍了Rubric-based和Preference-based两种评价模式,以及如何设计有效的评价提示词。
华盛顿大学CS教授Dan Grossman认为AI已接管编程"烦人细节",但精确说明算法行为、创造性设计能力仍是人类专属。艾伦学院调整教学方向,毕业生去向更多流向非科技公司的软件岗位。
OpenAI最新前沿模型正式登陆AWS Bedrock,GPT-5.4已上线,GPT-5.5即将接入。Altman以视频方式站台,OpenAI从微软Azure转向亚马逊云,标志着AI云服务竞争进入新阶段。
OpenAI将于近日限量推送GPT-5.5-Cyber网络安全模型,不面向公众开放,仅限经过审核的专业人士与机构。这是继GPT-Rosalind(生命科学版)之后,OpenAI限量准入策略的又一次落地,标志着AI安全竞争进入新阶段。
OpenAI推出GPT-5.5-Cyber网络安全定制模型,基于最强GPT-5.5打造,采用"可信准入"机制限量开放,不向公众提供,首批仅面向经过筛选的网络安全专业人士。
2026年5月1日,小米开源MiMo-V2.5系列四大模型。Pro版在SWE-Bench逼近Claude Opus 4.6,Token效率高出40-60%。4小时无中断完成macOS级系统开发。1M上下文窗口,TTS/ASR同步上线。同步启动Orbit计划免费发放百万亿Token。
2026年4月30日,苹果联合加州大学圣迭戈分校发布LaDiR框架,让LLM在推理时并行探索多条路径,再自回归输出结果。在LLaMA 3.1 8B和Qwen3-8B-Base上测试,数学和代码任务准确率明显提升。
AI大语言模型新手入门指南,四大免费平台推荐(DeepSeek/豆包/通义千问/Kimi),覆盖使用场景和选择建议。