GitHub 项目
- AI实验室员工呼吁减速机制 — 1132名头部AI实验室员工呼吁美国推动国际协调的AI减速机制。
- 千名AI员工呼吁放缓前沿模型 — 来自前沿AI公司的千余名员工呼吁由美国政府牵头建立控制AI发展速度的机制。
- Anthropic回应开放权重争议 — Dario称不主张禁开源权重,但强调出口管制、反蒸馏和强模型安全测试。
- Kimi K3登陆Nebius — Kimi K3作为开放权重模型在Nebius Token Factory首发上线,主打长程编码、推理、视觉和百万上下文。
- Kimi K3开源权重与技术栈 — 月之暗面发布2.8T MoE模型Kimi K3,支持视觉理解和100万token上下文。
- Claude Opus 5登陆AWS — Anthropic在AWS Bedrock上线Claude Opus 5,并提供工程集成建议。
- Opus 5早测接近Fable — Ethan Mollick称Opus 5短任务接近或超过Fable,但长程任务野心略弱。
- Opus 5强化学习迭代提速 — 传闻称Opus 5受益于更快迭代和规模化RL,安全分类器误拦截大幅下降。
- Claude Opus 5接入AI Gateway — Anthropic Claude Opus 5已在AI Gateway可用,强调长程编码、视觉和工具使用能力。
- Kimi K3发布:2.8T MoE百万上下文,定价对标闭源前沿 — Moonshot发布2.8万亿参数K3,百万上下文、原生多模态,7月27日开放权重,API输入定价每百万token 15美元进入GPT-5.5/Opus价格区间。
- OpenAI发布GPT-5.6三档模型,ChatGPT与Codex合并并推出Work智能体 — GPT-5.6分Sol/Terra/Luna三档开放,Sol输入5美元/百万token;ChatGPT与Codex合并为统一桌面应用,新增可跨应用自主执行任务的ChatGPT Work与Sites一键建站。
- Meta发布Muse Spark 1.1 — Meta推出偏Agent和代码能力的新模型,并开放Meta Model API。
- GPT 5.6三模型登陆AI Gateway — OpenAI GPT 5.6以Sol、Terra、Luna三档在AI Gateway限量预览。
- Grok 4.5开始滚动发布 — Grok 4.5据称在编码基准接近顶级模型,并提供50万token上下文。
- GPT-Live将进入API — OpenAI称GPT-Live和mini版本将很快开放API,用于更自然的实时语音交互。
- Claude Cowork转向手机控制 — Anthropic让Claude Cowork在合上笔记本后仍可继续执行任务。
- 商务部解除管制,Claude Fable 5/Mythos 5 恢复访问 — Anthropic 称美商务部撤销对两款模型的出口管制,明日起分批恢复访问。
- 美商务部长致信解除对 Anthropic Fable 5 出口管制 — Lutnick 信件确认放开 Fable 5、Mythos 5 出口,前沿模型可重回受限市场。
- Claude Sonnet 5 发布,SWE Bench Pro 升至 63.2% — Anthropic 推出最具自主性的 Sonnet,性能接近 Opus 4.8 但价格更低。
- 隆重推出克劳德十四行诗 5,这是我们迄今为止最具活力的十四行诗。它制定计划,使用浏览器和终端等工具,并以几个月前需要更大 — 隆重推出克劳德十四行诗 5,这是我们迄今为止最具活力的十四行诗。它制定计划,使用浏览器和终端等工具,并以几个月前需要更大、更昂贵的模型的水平自主运行。视频
- Cursor 发布 iOS 应用:随处启动云端编码 agent — 可启动常驻云端 agent 或远程操控电脑上的 agent,支持 PR diff 审阅,暂不开放欧盟。
- OpenAI预览GPT-5.6三档模型:Sol/Terra/Luna — OpenAI限量预览新一代前沿模型Sol及均衡档Terra、高量档Luna,主打编码、科学与网络安全。
- 白宫要求OpenAI推迟GPT-5.6发布 — 在Anthropic顶级模型下架两周后,白宫又要求OpenAI延后GPT-5.6上市。
- 热议600亿收购Cursor打通AI全链路 — 推文吹捧借600亿收购Cursor打通算力-模型-开发者入口闭环,拿下百万日活与代码数据。
- SpaceX拟600亿美元全股票收购Cursor — IPO仅5天,SpaceX宣布以600亿全股票收购Cursor补强AI部门,称看好26万亿市场。
- 深度学习该用哪个Schatten-p范数? — 论文证明最优Schatten-p几何取决于训练regime,低维场景下更小p范数反而占优。
- 复盘Anthropic下架:沟通比技术更定生死 — 评论认为Anthropic败在与白宫沟通失频,顶尖模型也救不了对不上频道的谈判。
- 五角大楼9月前清零Anthropic AI工作流 — 五角大楼称已切走逾2/3 Anthropic用量,目标9月前清零,源于年初拒签全用途协议。
- 亚马逊等六家公司被指触发对Anthropic Fable的打压 — 亚马逊CEO等向白宫警告Fable安全漏洞,数小时内模型被出口管制令强制下线。
- ChatGPT升级跨对话长期记忆系统 — OpenAI将记忆研究成果落地为更强系统,可跨对话承载上下文并长期保持有用。
- Claude Opus 5登顶AA智能指数 — Opus 5在AA智能指数以61分小幅领先,并以更低任务成本接近Fable 5。
- FlashKDA开源加速Delta Attention — Moonshot开源CUTLASS版Kimi Delta Attention内核,H20上预填充提速1.72至2.22倍。
- AI与国家安全:有些事说不通 — 一篇仅获HN一票、无实质正文的讨论帖,质疑AI国家安全叙事自相矛盾。
- OpenAI推Patch the Planet助开源修漏洞 — Daybreak计划用AI加专家复核帮开源维护者发现、验证并修复漏洞。
- 美政府要GPT-5.6改逐客户审批的受控预览 — 据报美政府要求OpenAI把GPT-5.6改为小范围、逐客户批准的受控发布,顾虑自动化网络攻击。
- OpenAI 推 GPT-Rosalind,专攻生命科学科研 — 面向企业级生命科学的模型系列,融合 GPT-5.5 的 agentic 编码与药物发现能力。
- Claude Sonnet 5 上线 Vercel AI Gateway — Sonnet 5 在编码与 agent 任务上多数达到原 Opus 水平,却维持 Sonnet 定价。
- 端侧UI视觉语言模型StepX-Edge — StepX-Edge以0.9B参数在端侧实现OCR、屏幕理解、问答和元素定位。
- Thinking Machines首发开源多模态模型 — Thinking Machines发布9750亿参数开源模型Inkling,面向视频和音频理解。
- Qwen提出技能自博弈训练法 — Qwen论文用可演化技能库约束自生成任务,提升LLM训练数据质量。
- SuperFlow改进流模型RL训练 — SuperFlow针对流匹配模型提出在线RL训练框架,优化采样效率与逐步信用分配。
- Claude Opus 5发布 — Anthropic以Opus 4.8同价发布Opus 5,性能接近Fable 5且成本减半。
- Meta发布Muse Spark 1.1 — Muse Spark 1.1上线Meta Model API预览,DeepSWE较前代提升43分。
- Claude Sonnet 5 登陆 AWS,Anthropic 最强 Sonnet — Anthropic 新一代首个 Sonnet 模型上线 Bedrock 与 AWS Claude 平台,以 Sonnet 价位提供顶级智能。
- OpenAI推出GPT-Live-1 — GPT-Live-1为ChatGPT带来全双工语音,可边听边说并委托前沿模型处理复杂问题。
- Kimi K3缩小开源模型差距 — Kimi K3在AA智能指数得57分,与顶级闭源模型差距缩至4分。
- 病理基础模型鲁棒微调 — 新微调方案提升10个病理基础模型对扫描与染色差异的鲁棒性。
- Kimi K3论文详解长程智能训练 — Kimi K3通过KDA/MLA混合注意力、NoPE、长上下文课程和工具RL重构长程代理训练。
- OpenAI联合博通首秀自研推理芯片Jalapeño — OpenAI首秀与博通合设的推理芯片Jalapeño,称性能媲美Blackwell/TPU,仅供内部年底部署。
- 实测Fable 5:大版本级阶跃,极擅长难题攻坚 — 使用两天评价Fable 5为Mythos加护栏版,全面SOTA,堪比4.5级别的阶跃。
- 英伟达等结盟支持开源AI — 英伟达、Meta、微软、Mistral等共同强调开放模型的可控性与主权价值。
- Claude私聊被搜索引擎收录 — Claude聊天分享页被Google和Bing索引,暴露所谓私密对话。
- DiffusionGemma:文本生成快至4倍 — 谷歌实验性开放模型DiffusionGemma整块生成文本,专用GPU上输出快至4倍。
- 亚马逊重押前沿大模型 — 亚马逊收缩多条 Nova 产品线,将工程与算力转向新的前沿模型项目。
- 现代生成图像检测基准DailyBench — DailyBench覆盖现代生成与编辑管线,评估AI图像检测能力。
- Meta联手贝莱德建AI数据中心 — Meta与贝莱德成立合资公司,投资140亿美元建设得州AI数据中心园区。
- 文档分类的分层强化学习 — DocHRL按文档难度动态选择分类策略,以降低模型与人工处理成本。
- 多模态模型的分辨率自蒸馏 — RP-OPSD利用高低分辨率视图的信息差,为MLLM提供可扩展监督。
- Kimi K3开放权重发布 — Moonshot发布2.6T参数Kimi K3权重,并登上Artificial Analysis开源权重模型首位。
- 苹果起诉OpenAI涉窃取硬件机密 — 苹果指控OpenAI鼓动被挖走的员工带走机密演示文稿、秘密原型及关键供应商信息,正式提起诉讼。
- GitHub MCP实现数据集发布 — 论文从GitHub构建首个大规模真实MCP实现数据集,用于分析其结构与维护方式。
- SeeMe降低多模态幻觉 — SeeMe通过训练-free视觉token工程减少LVLM由噪声视觉token引发的幻觉。
- 自动驾驶交通规则推理 — MapDR用细粒度标注支持模型理解标志、车道和场景上下文的规则适用性。
- 杂草识别MLLM引入强化学习 — WeedExpert-R1用强化学习提升多模态模型的植物学推理与杂草定位能力。
- 本地LLM运行电费实测 — 作者在Apple Silicon上用墙插功耗实测五个本地模型持续生成的真实能源成本。
- 雷达人动重建的仿真先验 — mmSimPrior用仿真预训练缓解毫米波雷达人动重建的数据稀缺。
- GPT-6发布前监管信号升温 — 围绕OpenAI强模型进华盛顿预沟通的传言,暗示下一代模型发布可能伴随安全审批。
- 离散扩散到底学什么 — 论文从CTMC ELBO推导解释离散扩散中去噪器、score ratio与桥预测器的等价关系。
- 生成回放中的合成真实捷径 — 论文指出合成旧类与真实新类混训会导致类增量学习退化。
- 分类引导的文档视觉抽取 — 论文用文档类型分类引导LVLM抽取多类型视觉文档信息。
- Mixture-of-LLMs横向扩展定律 — cMoLLM研究在LLM全流水线使用混合专家式横向扩展的规律。
- 双对抗微调增强LVLM鲁棒性 — 论文提出同时利用视觉与语义监督的双对抗微调框架,提升多模态任务抗攻击能力。
- OpenAI 发布 ChatGPT Work:Codex 加持的通用工作 agent — OpenAI 将 ChatGPT 与 Codex 合并为 ChatGPT Work,由 GPT-5.6 驱动,可跨应用和文件执行数小时长任务,覆盖移动端与网页端。
- OpenAI 发布 GPT-Live 新一代语音模型 — OpenAI 推出语音模型 GPT-Live,主打自然对话体验,即日起在 ChatGPT 灰度上线,API 与 Codex 集成开发中。
- SpaceX 600 亿美元全股票收购 Cursor 母公司 — SpaceX 上市数日即出手收购年化营收 26 亿美元的 Anysphere,溢价近一倍。
- 实测Fable 5:极度主动,会自己动手排查 — 使用两天总结Fable 5最大特征是'极度主动',会调动一切手段直达目标。
- DeepSeek V4 Flash跑上Strix Halo — 开发者在Ryzen AI MAX+ 395上本地运行DeepSeek V4 Flash并达32 tok/s。
- AI数学推理综合综述 — 综述梳理语言模型、神经符号系统和可验证发现的数学推理进展。
- OpenAI AGI部署CEO Fidji Simo宣布离任 — Fidji Simo在长期病假后卸任OpenAI AGI部署CEO,转为兼职顾问,该职位设立仅约一年。
- Anthropic简化MCP核心协议 — MCP核心从有状态会话转向无状态请求响应,复杂能力拆为可选扩展。
- Hugging Face披露自治代理攻击 — Hugging Face公开首起自治代理网络攻击的技术时间线、回放与防御过程。
- Kimi K3开源代码被深度拆解 — Baseten工程师从K3源码梳理出从GPT-2到KDA注意力的七年技术演进。
- Kimi K3 复古游戏生成测试以半价胜过 Opus 4.8 — Atomic Chat 让各模型生成单文件自玩 HTML 游戏:Kimi K3 花费 $0.28 完成度最高,Opus 4.8 花 $0.54,GPT-5.6 画面最好但逻辑失效。
- 语言模型中的文化绑定头 — 研究在8个模型中定位少数中层注意力头,验证其对文化身份绑定有因果作用。
- Kimi K3本地部署门槛 — Kimi K3以2.8万亿参数刷新开源权重规模,但本地推理需要机柜级显存。
- 利用CLS双特性的异常检测 — DuoAD利用ViT CLS嵌入与注意力图做免训练少样本异常检测。
- GPT-5.6与ChatGPT Work发布 — GPT-5.6在多项智能体与浏览评测领先,ChatGPT Work强化跨应用产出能力。
- AI编码代理加速科研软件维护 — OpenAI报告显示编码代理可显著提速生命科学软件优化,但验证仍是瓶颈。
- 视觉语言导航的最小充分表示 — BrainNav用逻辑锚点与最小充分原则减少导航中的无关视觉信息。
- 扩散语言模型的多块编辑 — 论文提出多块编辑,缓解块扩散语言模型的跨块上下文不可逆问题。
- LLM模拟实验效果遭质疑 — 论文指出统计逼真度不能证明LLM能准确估计社会科学实验处理效应。
- OpenAI 2025 年亏损激增近 8 倍,支出达 340 亿美元 — 独家财务分析称 OpenAI 年度总支出 340 亿美元,亏损同比暴增。
- 千名AI研究员呼吁放缓自动研发 — 1132名前沿实验室研究员要求美国政府治理自动化AI研发风险。
- 英伟达等呼吁开放模型合法化 — 英伟达联合多家机构强调开放模型对主权、成本和安全研究的重要性。
- Kimi K2.7代码高速模式发布 — Kimi推出K2.7 Code HighSpeed,编码任务最高提速约6倍。
- 欧盟裁定谷歌须向AI对手开放安卓11项系统能力 — 欧盟依DMA要求谷歌开放Android 11项功能并共享搜索数据,第三方AI助手可获语音唤醒等系统级入口,2027年7月生效。
- GUI智能体奖励框架 — SeekJudge用模型化判断替代易过时的规则评测,服务电脑使用智能体RL训练。
- OpenAI披露模型评估安全事故 — OpenAI与Hugging Face披露模型评估中发生的AI驱动安全事件早期结论。
- Gemini 3.5 Flash内置原生computer use — Gemini 3.5 Flash新增原生computer use,可构建跨浏览器/移动/桌面操作的agent。
- 红外成像用于儿童骨科分诊 — 综述讨论红外成像结合深度学习生成合成X光,作为儿童骨伤无辐射分诊方案。