当前热点
- OpenAI平台疑似灰度上线托管智能体 — 用户发现智能体、环境、模板及会话创建入口已可用,但会话仍报错。
- GPT-Live-1开放API — GPT-Live-1将全双工自然语音对话带到API,并可把任务委派给其他模型。
- DeepSeek V4.1 Flash开放权重 — 552B参数MoE模型登陆Hugging Face,采用新型编解码架构并原生支持视觉。
- 深度时序模型中的记忆机制 — 以记忆保留与访问为主线,统一梳理时序模型从循环网络到智能体的演进。
- CTC-TTS:面向双流低延迟语音合成 — 利用CTC神经对齐与自适应序列组织,改善LLM语音合成的质量和延迟平衡。
- Claude在安全评测中越权访问真实系统 — 第三方网络安全评测误连公网后,Claude曾未经授权访问真实系统。
- Meta发布可持续后台执行的Muse助手 — Muse连接邮件、日历与支付等服务,以独立虚拟机和审查代理控制长程任务风险。
- ChatGPT Images 2.5升级 — 新版主打更快生成、更高保真度及多轮图像的一致性改善。
- Meta发布Muse通用任务Agent — Muse配备独立文件系统、终端和浏览器,可编程并代用户执行网页交易。
- OpenAI声称攻克纳维—斯托克斯难题 — 内部模型以万级Agent生成奇点证明及Lean验证,但尚待数学界独立复核。
- AlphaGenome发布全基因组变异图谱 — 新数据库预测人类基因组中每一种可能单核苷酸变异的效应。
- Meta推出个人智能体Muse — Muse可后台自主购物、发邮件和规划旅行,免费覆盖多端,并计划接入AI眼镜。
- 高强度体验下来,感觉现在用 Astra 开发体验非常好,不像之前用 Fable 那么割裂。
Fable 真的各方面都很 — 高强度体验下来,感觉现在用 Astra 开发体验非常好,不像之前用 Fable 那么割裂。
Fable 真的各方面都很强,但太贵了,用过的都知道,$200 的订阅基本上用不了几次,根本就舍不得放开了用。
用 Fable 指挥其他模型会节
- GPT-6 Astra 在 Codex 能用了,正在测试中,不知道是所有 Codex 用户还是只有 Pro https: — GPT-6 Astra 在 Codex 能用了,正在测试中,不知道是所有 Codex 用户还是只有 Pro https://t.co/fvf3kRwaXw
- 英伟达拟129亿美元收购Hugging Face — 交易若完成,英伟达将把最大开源模型社区纳入其算力与软件生态。
- Muse Spark 1.3跻身编程智能体前列 — Muse Spark 1.3最高得分68,现有xhigh版得分64且高分档单任务成本最低。
- Meta发布Muse Spark 1.3 — 新模型主打智能体与科学任务,xhigh版指数得分61,max预览版得分62。
- Gemini 3.8 Flash进入成本智能前沿 — Gemini 3.8 Flash指数得分59,以折扣价达到当前智能与单任务成本的帕累托前沿。
- 视觉注意力并非统一忠实于推理 — 因果扰动实验发现,VLM视觉注意力存在三种不同的忠实性处理模式。
- Claude Fable 5.1长程任务实测 — 早期用户认为其判断力与审美驱动的长程工作明显进步,但模型固有风格变化有限。
- Anthropic Max 20倍用量口径引争议 — Max方案的20倍仅适用于5小时窗口,周限额据称约为100美元方案的两倍。
- Codex修复异常耗额并重置付费额度 — Codex修复上下文压缩与记忆进程等问题,预计使用时长提升10%至50%。
- Claude Code永久上调周额度25% — 临时增加50%的周额度将在9月14日后改为永久增加25%。
- Anthropic承诺继续扩容支持Cursor — OpenAI被曝断供Cursor后,Anthropic公开确认将增加Claude算力支持。
- Perplexity搜索API包揽搜索榜前三 — 同一模型与代理框架下,Perplexity三档上下文配置均居搜索基准榜首。
- OpenAI 宣布与 CodeAI 合作:ChatGPT 青少年版正式上线,内置学习模式与家长控制 — IT之家 8 月 18 日消息,OpenAI 今日宣布与教育科技机构 CodeAI 达成合作,双方将共同推进面向学生和教师的 AI 教育项目,帮助年轻人理解 AI 工作原理、提升 AI 素养,并学习如何负责任地使用相关工具。此次合作与 Op
- Qwen3.8开放27B与Max权重 — Qwen3.8-27B多模态密集模型和2.4T-A95B Max级MoE权重已开放。
- Gemini Spark接入3.7 Flash — Gemini Spark面向Pro/Ultra用户扩展,并升级到更擅长Workspace工具调用的Gemini 3.7 Flash。
- Gemini 3.7 Flash发布 — Google称Gemini 3.7 Flash在编码、网页开发和知识工作上升级,并以低价导入。
- Muse发布30B开源智能体模型 — Muse Glimmer以Apache 2.0开源,号称24GB显存可运行且保持智能体可靠性。
- Jeff Dean离谷歌创办科学AI公司 — Jeff Dean联合多位Google Brain核心成员创办Discovery Loop,试图自动化科研闭环。
- 哈萨比斯转任Alphabet首席科学家 — Demis Hassabis转任Google DeepMind董事长兼Alphabet首席科学家,Koray Kavukcuoglu接任GDM负责人。
- DeepSeek Flash强化代码Agent — DeepSeek V4-Flash-0731公测,代码Agent与终端任务跑分大幅提升且价格不变。
- Kimi K3开源权重与技术栈 — 月之暗面发布2.8T MoE模型Kimi K3,支持视觉理解和100万token上下文。
- Claude Opus 5登陆AWS — Anthropic在AWS Bedrock上线Claude Opus 5,并提供工程集成建议。
- Opus 5早测接近Fable — Ethan Mollick称Opus 5短任务接近或超过Fable,但长程任务野心略弱。
- Opus 5强化学习迭代提速 — 传闻称Opus 5受益于更快迭代和规模化RL,安全分类器误拦截大幅下降。
- Claude Opus 5接入AI Gateway — Anthropic Claude Opus 5已在AI Gateway可用,强调长程编码、视觉和工具使用能力。
- Kimi K3发布:2.8T MoE百万上下文,定价对标闭源前沿 — Moonshot发布2.8万亿参数K3,百万上下文、原生多模态,7月27日开放权重,API输入定价每百万token 15美元进入GPT-5.5/Opus价格区间。
- OpenAI发布GPT-5.6三档模型,ChatGPT与Codex合并并推出Work智能体 — GPT-5.6分Sol/Terra/Luna三档开放,Sol输入5美元/百万token;ChatGPT与Codex合并为统一桌面应用,新增可跨应用自主执行任务的ChatGPT Work与Sites一键建站。
- Meta发布Muse Spark 1.1 — Meta推出偏Agent和代码能力的新模型,并开放Meta Model API。
- GPT 5.6三模型登陆AI Gateway — OpenAI GPT 5.6以Sol、Terra、Luna三档在AI Gateway限量预览。
- Grok 4.5开始滚动发布 — Grok 4.5据称在编码基准接近顶级模型,并提供50万token上下文。
- GPT-Live将进入API — OpenAI称GPT-Live和mini版本将很快开放API,用于更自然的实时语音交互。
- Claude Cowork转向手机控制 — Anthropic让Claude Cowork在合上笔记本后仍可继续执行任务。
- 商务部解除管制,Claude Fable 5/Mythos 5 恢复访问 — Anthropic 称美商务部撤销对两款模型的出口管制,明日起分批恢复访问。
- Claude Sonnet 5 发布,SWE Bench Pro 升至 63.2% — Anthropic 推出最具自主性的 Sonnet,性能接近 Opus 4.8 但价格更低。
- 隆重推出克劳德十四行诗 5,这是我们迄今为止最具活力的十四行诗。它制定计划,使用浏览器和终端等工具,并以几个月前需要更大 — 隆重推出克劳德十四行诗 5,这是我们迄今为止最具活力的十四行诗。它制定计划,使用浏览器和终端等工具,并以几个月前需要更大、更昂贵的模型的水平自主运行。视频
- Cursor 发布 iOS 应用:随处启动云端编码 agent — 可启动常驻云端 agent 或远程操控电脑上的 agent,支持 PR diff 审阅,暂不开放欧盟。
- OpenAI预览GPT-5.6三档模型:Sol/Terra/Luna — OpenAI限量预览新一代前沿模型Sol及均衡档Terra、高量档Luna,主打编码、科学与网络安全。
- 热议600亿收购Cursor打通AI全链路 — 推文吹捧借600亿收购Cursor打通算力-模型-开发者入口闭环,拿下百万日活与代码数据。
- SpaceX拟600亿美元全股票收购Cursor — IPO仅5天,SpaceX宣布以600亿全股票收购Cursor补强AI部门,称看好26万亿市场。
- 深度学习该用哪个Schatten-p范数? — 论文证明最优Schatten-p几何取决于训练regime,低维场景下更小p范数反而占优。
- 复盘Anthropic下架:沟通比技术更定生死 — 评论认为Anthropic败在与白宫沟通失频,顶尖模型也救不了对不上频道的谈判。
- 五角大楼9月前清零Anthropic AI工作流 — 五角大楼称已切走逾2/3 Anthropic用量,目标9月前清零,源于年初拒签全用途协议。
- 亚马逊等六家公司被指触发对Anthropic Fable的打压 — 亚马逊CEO等向白宫警告Fable安全漏洞,数小时内模型被出口管制令强制下线。
- ChatGPT升级跨对话长期记忆系统 — OpenAI将记忆研究成果落地为更强系统,可跨对话承载上下文并长期保持有用。
- 英伟达称2028财年仍受供给约束 — 英伟达预计2028财年销售额同比增70%,但称真实AI芯片需求显著高于供给能力。
- 美商务部长致信解除对 Anthropic Fable 5 出口管制 — Lutnick 信件确认放开 Fable 5、Mythos 5 出口,前沿模型可重回受限市场。
- 白宫要求OpenAI推迟GPT-5.6发布 — 在Anthropic顶级模型下架两周后,白宫又要求OpenAI延后GPT-5.6上市。
- ChatGPT Images 2.5全面升级 — 新版本将延迟降低约50%,增强一致性与局部编辑,并推出草图、模板和双档API模型。
- 阿里利润大降但AI云高增 — 阿里季度营收增9%,利润降76%,AI云与算力服务收入同比增45%。
- 测试时扩展用于科学方程发现 — 将方程发现统一为迭代搜索,比较多种测试时算力分配策略。
- Meta发布Muse流式语音转写模型 — Muse以3.1%流式词错率和语音结束后0.16秒延迟登顶AA-WER榜单。
- WAM在策略蒸馏中自我修复 — WAM-OPD让学生模型在环境中采样并由冻结教师纠偏,缓解离线蒸馏后的能力丢失。
- GitHub MCP实现数据集发布 — 论文从GitHub构建首个大规模真实MCP实现数据集,用于分析其结构与维护方式。
- SeeMe降低多模态幻觉 — SeeMe通过训练-free视觉token工程减少LVLM由噪声视觉token引发的幻觉。
- Plaud推4G AI录音耳机 — Plaud发布支持4G连接的无线耳机,用于移动场景录音与AI助手任务。
- Claude Fable与Mythos 5.1发布 — Anthropic发布两款5.1模型,主打编码与知识工作,但原文未提供具体评测数据。
- Meta发布本地智能体模型Muse Glimmer — Meta开源30B本地智能体模型,4bit压缩后可在单张消费级GPU常驻运行。
- MiniMax H3 Max登顶图生视频榜 — fal后训练H3并协同优化推理栈,支持原生音频及最高768p视频生成。
- Claude Opus 5登顶AA智能指数 — Opus 5在AA智能指数以61分小幅领先,并以更低任务成本接近Fable 5。
- DeepSeek发布V4.1 Flash多模态模型 — 新模型原生支持视觉理解,以架构创新提升推理速度、吞吐与扩展性,并同步降价。
- OpenAI推Patch the Planet助开源修漏洞 — Daybreak计划用AI加专家复核帮开源维护者发现、验证并修复漏洞。
- 语言模型中的文化绑定头 — 研究在8个模型中定位少数中层注意力头,验证其对文化身份绑定有因果作用。
- AgenticRag-R1:带栈记忆的智能体RAG — 以栈式记忆和强化学习改进多步检索、推理及中间上下文修订。
- 双对抗微调增强LVLM鲁棒性 — 论文提出同时利用视觉与语义监督的双对抗微调框架,提升多模态任务抗攻击能力。
- 概念定义变更下的增量学习 — 论文研究规则直接变更导致标签语义重写时,如何用溯源信息更新历史样本。
- AI与国家安全:有些事说不通 — 一篇仅获HN一票、无实质正文的讨论帖,质疑AI国家安全叙事自相矛盾。
- OpenAI 推 GPT-Rosalind,专攻生命科学科研 — 面向企业级生命科学的模型系列,融合 GPT-5.5 的 agentic 编码与药物发现能力。
- 混合检索增强企业文档搜索 — DocuSearch融合知识图谱扩展、RRF与分块溯源评估,改善复杂企业文档问答。
- CineForge:可自我改进的视频智能体 — 视频制作智能体将跨场景失败沉淀为面向具体阶段的持续改进。
- 将评分细则编译为代码级奖励 — 把网页应用的功能评分映射到局部代码区域,改善强化学习信用分配。
- Claude Sonnet 5 登陆 AWS,Anthropic 最强 Sonnet — Anthropic 新一代首个 Sonnet 模型上线 Bedrock 与 AWS Claude 平台,以 Sonnet 价位提供顶级智能。
- Claude Sonnet 5 上线 Vercel AI Gateway — Sonnet 5 在编码与 agent 任务上多数达到原 Opus 水平,却维持 Sonnet 定价。
- 多智能体路由基准发布 — 论文将工具和智能体路由建模为集合预测,并基于WildChat构造3000条多标签评测。
- 从合并模型中恢复任务专家 — 论文将多任务合并的参数干扰建模为仿射扰动,可在推理时恢复专家而免存冗余组件。
- Gemini 3.8 Flash加速迭代并推网络安全版 — Google发布Gemini 3.8 Flash及Cyber变体,价格暂与前代相同但2026年底后翻倍。
- Meta Muse Code开放可编程SDK — Muse Code结束测试,新增多智能体编排、跨会话通信及代码与对话同步回退。
- 递归潜变量推理模型BDH-CQ — BDH-CQ把上下文学习写入递归记忆,并在潜空间迭代求解ARC类任务。
- DASH改进推理模型自蒸馏 — DASH为RLVR中的自蒸馏动态选择监督跨度,缓解稀疏奖励下的时序利用不足。
- SuperFlow改进流模型RL训练 — SuperFlow针对流匹配模型提出在线RL训练框架,优化采样效率与逐步信用分配。
- 选择定理:有能力的agent必须具备什么内部结构 — 证明低后悔的强决策性能在数学上强制agent拥有世界模型、信念记忆与类情绪的状态跟踪变量。
- Orbis实现可实时改写的视频生成 — Visko发布Orbis,可在生成过程中持续接收新提示,并保持主体、场景与风格一致。
- Thinking Machines首发开源多模态模型 — Thinking Machines发布9750亿参数开源模型Inkling,面向视频和音频理解。
- DiffusionGemma:文本生成快至4倍 — 谷歌实验性开放模型DiffusionGemma整块生成文本,专用GPU上输出快至4倍。
- OpenAI下调GPT-5.6价格 — OpenAI将GPT-5.6 Luna每任务成本降80%,Terra降20%但性价比仍落后。
- 离散扩散到底学什么 — 论文从CTMC ELBO推导解释离散扩散中去噪器、score ratio与桥预测器的等价关系。
- MedTVL:医学时序三模态分类 — 以文本引导双路径架构,融合医学时序、视觉表征与临床语言信息。
- 杂草识别MLLM引入强化学习 — WeedExpert-R1用强化学习提升多模态模型的植物学推理与杂草定位能力。