「AI资讯日报」· 2026-08-13
今日 14 条 AI 资讯汇总(模型发布/产品更新/研究/观点),附原文链接。
1. DeepSeek V4 Pro和xAI Grok 4.6同日发布,参数分别为1.6T和1.5T,整体体验接近Claude Fable 5,普通用户可更快体验新对话与推理。:DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。 原文链接
2. 空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈:Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。 原文链接
3. 阿里开源Qwen3.8-2.4T-A95B:2.4万亿参数MoE、激活95B,原生支持262K上下文,最高可扩展到101万token,方便本地长文本使用。:阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。 原文链接
4. 微软首发自研推理模型MAI-Thinking-1:我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下。 原文链接
5. 我写了一本 AI 教科书--AI 还要多久才能写得更好?:作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。 原文链接
6. Meta开源Muse Glimmer,并上架OpenRouter:30B文本+图像模型,Apache 2.0授权,可用于本地智能体与视觉任务。:Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线! 这是一款 30B 密集文本+图像模型,采用 Apache 2.0 许可证,旨在成为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。 https://openrouter.ai/meta/muse-glimmer-30b 原文链接
7. LTX-2.5支持生成10秒720P视频:在英伟达GB200双卡环境下用时6.8秒,并原生集成ComfyUI,降低视频生成门槛。:LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。 原文链接
8. 零基础用户半天上手AI的12步实操流程:文章给出一套零基础用户半天上手AI的12步实操流程:准备内存不低于16G的电脑,订阅ChatGPT并安装Codex或使用WorkBuddy,用语音输入法以【背景、痛点、需求】框架向AI交代任务,经苏格拉底提问澄清需求后投喂文件让AI直接完成,最后沉淀为可复用Skill。文中建议Codex选GPT-5.6 Sol最高模型,WorkBuddy选Kimi K3。 原文链接
9. Cursor 与 SpaceXAI 联合发布 Grok 4.6:Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。 原文链接
10. xAI 发布 Grok 4.6,强化长时运行智能体能力:xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。 原文链接
11. OpenRouter上线实时网页搜索基准:把搜索轮次从1增到25,BrowseComp接近翻倍,成本只增加2.5-7倍;适合选引擎与深度来控花费。:OpenRouter 发布实时排行榜,系统评测模型、搜索引擎、搜索方法与预算四类配置组合。数据显示,将搜索预算从 1 轮增至 25 轮可使 BrowseComp 得分近乎翻倍,成本仅增 2.5-7 倍;模型选择比引擎更重要,平均分差 15 分 vs 10 分。失败率高的任务应降低搜索深度以控制成本。 原文链接
12. Chrome侧边栏的Claude对话升级为Claude Cowork:对话会保存在历史记录里,技能和连接器可在手机、网页和桌面间切换。:Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。 原文链接
13. Research Gold 号称"100%人类撰写、绝不使用AI",实则全程由AI驱动:面向医学研究者的网站 Research Gold 宣称其服务"100%由人类撰写、绝不使用AI",并列出多名博士审稿人。但调查发现,这些审稿人系AI生成、并不存在;部分真实方法学家的身份和照片未经许可被挪用。致电该公司时,自称"Sarah"的AI助手坚称自己是真人,邮件与聊天回复也均为AI生成。 原文链接
14. AutoGPT用AGENTS.md与技能门控管理PR:强制PR模板、测试和CI门槛,必要时用CLA签名做“人类探测器”,让拉取请求更可靠。:AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。 原文链接