今日亮点

最新更新

精选 3 条关键更新,点击可跳转到正文

今日精选资讯3

Perplexity Portable Computer 上线 Windows:本地 Agent 跑在 RTX 上,不耗云端额度

智能代理
来源:Perplexity 官方博客·
查看原文
事件内容

Perplexity 于 2026 年 9 月 14 日在官方博客宣布,Portable Computer 已进入 Windows 版 Perplexity 应用,面向要把敏感文件和长流程留在本机的 Pro / Max 用户(个人与企业套餐均可)。此前 8 月先在 NVIDIA DGX Spark(Linux)上线;本次把本地 Agent 编排扩到符合条件的 Windows RTX 电脑。亦见于 NVIDIA 博客。

  • 本机跑什么:官方写明,Portable Computer 在用户自己的硬件上跑本地模型,处理敏感文件与本地工具,不必把这层工作送上云,也不消耗 Computer 额度;可跑循环任务和长工作流。Windows 版把 Computer 的本地 agent harness 与编排器加进现有 Windows 应用。
  • 怎么开:从 Microsoft Store 安装 Perplexity for Windows,在模型下拉里选要下载的本地模型,一键拉取。官方要求本机推理使用 NVIDIA GeForce RTX 或 RTX PRO,显存至少 24GB
  • 云端怎么接:官方定位仍是本地优先;需要更强研究/推理时可以升到云端,NVIDIA 渠道稿补充须先征得用户同意再把信息送出设备。具体云端模型名单与计费,以应用内为准。
  • 核对范围:一手以 Perplexity 当日博客为准。NVIDIA 稿举例本地模型「如 Qwen 3.8 27B」,8 月 DGX Spark 公告则同时写 Qwen 3.8 27B 与后训练的 PPLX 27B——Windows 当天到底预置哪一款,打开应用内模型列表再确认,本文不把渠道举例写成已核实清单。DGX Station 支持 NVIDIA 写明即将推出,尚未给日期。
资讯解读

个人 Agent 要进办公电脑,真正过关的是「敏感材料不出设备、长任务不烧云端额度」。Portable Computer 把编排器放到 Windows RTX 上,等于把「本地优先、必要时再上云」从 DGX 工作站扩到更多开发机。先确认你的卡是不是 24GB 档,再决定要不要把报税、合同、代码仓库从云端对话里挪出来。

谁将受益
已有 24GB 档 RTX、并订了 Perplexity Pro/Max 的知识工作者

适合先拿一份不能上传的合同或本地仓库试「全程本机」。建议对照云端 Computer 看质量差在哪,再决定哪些流程留下、哪些仍升云。

安全 / IT

可把「本机推理 + 升云须确认」当成评估其他桌面 Agent 的对照。上线前仍要核显卡型号、企业套餐是否开放,以及应用对文件夹、连接器的授权范围,不要把 NVIDIA 稿里的连接器名单当成已对你账号生效。

GitHub Copilot Auto 可选成本/质量三档:同一套模型,按任务偏好改路由

编程开发
来源:GitHub Changelog·
查看原文
事件内容

GitHub 于 2026 年 9 月 14 日在 Changelog 宣布 Copilot 自动选模型新增三档:efficiency(效率)、balance(均衡)、intelligence(智能),面向已在用 Auto 的开发者,用来告诉路由「更在意省钱、均衡,还是质量」。官方文档把带任务优化的 Auto 标为在 GitHub 网站 Chat、VS Code、Copilot CLI 与 Copilot app 正式可用。

  • 三档怎么偏:Efficiency 优先压成本,适合快而直接的任务;Balance 同时权衡成本、质量与延迟,适合日常;Intelligence 优先质量,面向复杂任务。三档用的是同一组可用模型。Auto 仍会逐条评估提示词——官方举例:即便选了 Intelligence,给已有函数加 docstring 仍可能落到小而省的模型。
  • 怎么计费:按 Auto 实际选出的模型计费,与所选档无关。付费订阅在 Auto 用量上继续享受 10% 折扣。文档写明路由会卡在自然的缓存边界上换模型,避免会话中途切换把缓存打掉。
  • 哪里能选档:Changelog 写明三档正在 VS Code、Copilot CLI 与 GitHub Copilot app 滚动放出。文档加了一句:档位仅这些客户端有;网站 Chat 虽有带任务优化的 Auto,但没有这三档开关。JetBrains / Eclipse / Xcode / Visual Studio 上的 Auto 目前是「按健康度与可用性选模型」,不是这套成本/质量档。
  • 策略边界:Auto 不会用你套餐没有的模型、管理员策略排除的模型、以及数据驻留 / FedRAMP / Evaluation 策略禁止的模型。个人套餐用户可随时关掉评估模型。悬停回复(Chat)、终端(CLI)或模型选择器旁可以看到实际用了哪颗模型。
资讯解读

Auto 不再只是「帮你挑一颗模型」,而是让你先选成本口味,再让路由按每条提示词微调。真正要改的工作流是:默认日常用 Balance,把 Intelligence 留给架构和排障,把 Efficiency 留给补注释和改文案——而不是把三档都开成 Intelligence 再奇怪账单为什么没降。

谁将受益
已在 VS Code / Copilot CLI / Copilot app 用 Auto 的开发者

升级后先看本机有没有三档开关。建议用同一条「加注释」和一条「重构模块」对照 Intelligence 与 Efficiency 实际落到哪颗模型、花了多少,再改团队默认档。

工程效能 / 账单负责人

10% 折扣只作用于 Auto 用量。先确认组织模型策略没有把便宜模型全挡住,否则 Efficiency 档也省不下来。JetBrains 用户先别等这三档,他们这边仍是可用性路由。

Bedrock AgentCore 上线托管 Consent 门户:用户 OAuth 授权不用再自建回调

智能代理
来源:AWS 机器学习博客·
查看原文
事件内容

AWS 于 2026 年 9 月 14 日发文(Announcements),面向已在 Amazon Bedrock AgentCore Gateway 上用三方 OAuth(3LO / 授权码)的团队:AgentCore Identity 现提供托管 Consent 门户和会话绑定端点,终端用户可先登录公司 IdP、再按服务逐项授权,应用不必再自建授权页与公网回调。官方开发者文档同步给出控制台与 CLI 配置步骤。

  • 以前缺什么:走 3LO 时,客户得自己展示授权 URL、托管公网 HTTPS 回调、辨认回跳用户、管浏览器会话,再调 `CompleteResourceTokenAuth`。新门户把浏览器跳转和会话绑定收走,令牌进 AgentCore Identity 的 token vault。文档写明令牌留在服务端,浏览器不持有 token。
  • 谁在用:官方点名 IDE / MCP 客户端(Kiro、Claude Code、Cursor、VS Code)尤其合适——用户可在调工具前先授权,后续调用复用已存令牌。示例是开发助手同时接 GitHub(列仓库、建 issue)与 Slack(列频道、发消息),两套授权互相独立。
  • 管理员做什么:每个 Gateway 只能建一个门户且创建后不能换 Gateway。需准备:带 JWT 入站授权的 Gateway、公司 IdP 的 OIDC 应用(至少 `openid`)、GitHub/Slack 等出站 OAuth 应用、以及门户执行角色。门户 Active 后给出 URL,形态为 `https://<id>.consent-portal.bedrock-agentcore.<region>.amazonaws.com`;把 `/callback` 登到公司 IdP,把 `/connect/callback` 设成各 3LO target 的默认回跳。
  • 审计与边界:CloudTrail 可看 `GetResourceOauth2Token`、`CompleteResourceTokenAuth`、`GetWorkloadAccessTokenForJWT`。提供方若没发 refresh token,过期后用户要回门户再授权。这是 AgentCore Identity 的托管能力,不是新的通用 OAuth 标准发布日。区域、配额与报价请打开 AgentCore 控制台与定价页再写进变更单。
资讯解读

Agent 要代用户点 GitHub / Slack,卡住的往往不是模型,而是「授权页谁来托管、令牌怎么绑回这个人」。AWS 把会话绑定收成一条可分享的 URL,等于让 IDE 里的 MCP 工具可以先完成企业 IdP + 逐服务同意,再进仓库。先在预发对一个 GitHub 只读 scope 走通,比一上来把发 Slack 的写权限交给门户更稳。

谁将受益
已在 AgentCore Gateway 上接 3LO 的平台团队

适合用来拆掉自建回调。建议先在预发建门户,用公司 IdP 走一遍 GitHub 只读,看 CloudTrail 里会话绑定是否落到正确用户,再对开发者公布 URL。

用 Cursor / Claude Code / VS Code 调公司 MCP 的开发者

收到门户链接后,按需 Connect,不要把 Slack 和 GitHub 一次全开。若工具突然要你重新授权,先查是不是 refresh token 没发下来,而不是先怪客户端。

过去一周精选资讯12

DeepSeek 上线 V4.1-Flash:新架构压低长上下文成本,旧 Flash 已切走

模型平台
来源:DeepSeek 官方 API 文档·
查看原文
事件内容

DeepSeek 在官方 API 文档发布 DeepSeek-V4.1-Flash(News 标注 2026/09/10),面向长上下文与视觉 Agent 团队;Hugging Face 权重近 24 小时仍在更新。官网首页无带日期公告,一手出处是 API News / Change Log / 定价页与模型卡。

  • 规格:官方称这是新架构家族里最小的一款,原生看图。552B 参数 MoE;Causal Encoder–Decoder 非对称激活——输入约 8B、输出约 16B。上下文 1M,最大输出 384K。支持 thinking / 非 thinking,推理强度可在 1–100 连续调节。权重 MIT 许可。
  • 成本结构:官方对比上一代,KV cache 只要约 1/4 HBM、1/8 SSD;模型卡写明全局 KV 约 890 字节/token。缓存命中往往占 Agent 账单大头,压 cache 就是压长上下文费用。
  • 怎么调用:新模型名 `deepseek-flash`。旧名 `deepseek-v4-flash`、`deepseek-v4-flash-vision-exp` 已退役,暂时路由到 V4.1-Flash 并按 Flash 价计费。Flash 支持视觉;V4 Pro 官方定价表写明不支持视觉。并发上限 Flash 2500、Pro 500。官方点名 WorkBuddy(含 CodeBuddy)与 OpenCode 已接好。
  • 定价(官方美元,每百万 token):Flash 非高峰:缓存命中 $0.003、未命中 $0.15、输出 $0.60;高峰为 2 倍。高峰时段为工作日 01:00–04:00 与 06:00–10:00 UTC,其余为非高峰。新定价自 2026-09-10 04:00 UTC 生效。
  • V4 Pro 口径必须再核:News 页仍写「2026-09-14 04:00 UTC 起,`deepseek-v4-pro` 将改走 V4.1-Flash 并按 Flash 价」。但 Change Log 与定价页脚注已改口:应需求,9 月 14 日之后继续提供 V4 Pro,计价不变。上线前以 Change Log / Models & Pricing 为准,不要只看 News 旧句。
资讯解读

DeepSeek 这次卖的不是「又一个更大的 Flash」,而是把长上下文的内存账单砍下来,再用更低的 API 价和新模型名把主力切过去。对已经写死旧 Flash 名称的团队,代码可以先不动、价已经变了;对还在用 V4 Pro 的团队,News 与 Change Log 现在说法不一致——9 月 14 日前必须再打开定价页看一眼,别按过期路由声明做迁移。

谁将受益
用 DeepSeek 跑长上下文 / 看图 Agent 的开发者

先把调用名改成 `deepseek-flash`,再拿一条你们最贵的长上下文任务对账单。建议对照「缓存命中率 × 是否落在 UTC 高峰」拆一周流水,而不是只看标价。

平台 / 推理成本负责人

890 字节/token 和 2500 并发是自建与买 API 都要重算的数字。若你们按 V4 Pro 的显存与并发做了容量规划,先按 Flash 重算一版,再决定要不要把高峰任务挪到非高峰。

GitHub Copilot 代码审查会自动关掉已改完的评论,Lite 档改用多智能体复审

编程开发
来源:GitHub Changelog·
查看原文
事件内容

GitHub 于 2026 年 9 月 11 日更新 Copilot code review,面向已在用 Copilot 审 PR 的工程团队:它会在你改完问题后自动关掉对应评论,并在 Lite 档用多个智能体复审。

  • 自动关闭:你推送的后续 commit 若已处理某条 Copilot 评论,复审时会自动 resolve;没改完的继续开着,避免评论区堆着过期意见。
  • 智能提交说明:一键应用 Copilot 的改代码建议时,不再套默认 commit message,而是按这次改动生成说明。
  • 审得更深:复审现在用上 Copilot SDK 的全套 shell 工具(在 agent 防火墙后),可跑构建、测试、脚本,并向可用工具/API 取证。官方称实验里正面反馈增多,高严重度发现更多、吹毛求疵更少。
  • Lite 改集成:Lite 档不再单智能体单干,而是多个智能体各自看、再合成一份审查。官方实验:高/中/低严重度「被采纳评论」分别多 47% / 31% / 11%,审查成本约降 8%。这些改动只提高审查质量,不改变你怎么发起或接收审查。
资讯解读

代码审查的瓶颈经常不是「AI 会不会提意见」,而是「过期意见清不掉、Lite 档不够深」。GitHub 这次把「改完就关评论」和「Lite 也上多智能体」一起补上,等于让日常档更像能收尾的复审,而不只是多一层噪音。数字来自官方自测,落地前用你们仓库里最吵的那类 PR 试一轮更稳。

谁将受益
日常开/审 PR 的开发者

适合先在一条真实 PR 上试「改完是否自动关掉旧评论」。若评论仍堆着,检查是不是后续 commit 其实没覆盖那条反馈,而不是先怪自动关闭。

工程负责人

Lite 档成本约降 8%、高严重度采纳变多,值得拿一周的审查数据对照。建议分开看「被关掉的过期评论」和「新出现的高严重度」,避免把清评论当成质量提升。

GitHub Copilot 用量报告正式计入 VS Code Agents 窗口,和企业编辑器 Agent Mode 分开算

编程开发
来源:GitHub Changelog·
查看原文
事件内容

GitHub 于 2026 年 9 月 11 日宣布 Copilot 用量指标正式纳入 VS Code Agents 专用窗口,面向企业主、组织主和账单管理员,用来看有多少人真在用独立 Agent 窗口、用得有多勤。

  • 企业/组织汇总(1 天与 28 天):新增可选字段 `daily_active_vscode_agent_users`(当日独立活跃用户),以及 `totals_by_vscode_agent`(`session_count` 与 `total_user_messages`)。
  • 用户级报告:新增 `used_vscode_agent`(是否用过该窗口),以及每用户的 `totals_by_vscode_agent`。
  • 边界:只覆盖 VS Code Agents 专用窗口,与编辑器里的 Agent Mode、通用用量汇总分开。没有数据时字段保持缺省或 `null`,兼容旧报表。
  • 谁能看:企业 owner / billing manager、组织 owner,以及被授予 `View Copilot Metrics` 的自定义角色;且必须先打开 Copilot usage metrics 策略。
资讯解读

企业买的是「席位」,真正要管的是「谁在哪个窗口里跑 Agent」。GitHub 把 VS Code Agents 窗口单独记一笔,等于承认编辑器内补全和独立 Agent 窗口不是同一件事——混在一个活跃用户数里,会高估或低估 Agent 采用率。

谁将受益
工程效能 / IT 管理员

先确认 Copilot usage metrics 策略已开,再把 `daily_active_vscode_agent_users` 和编辑器 Agent Mode 对照看。建议抽两个团队比一周:窗口活跃高但合并 PR 没变,多半是在试用,还不是工作流。

关注 Copilot 账单的负责人

用户级 `used_vscode_agent` 适合用来找「开了席位却几乎没进 Agents 窗口」的账号。先别据此回收席位,先问是不是被策略或安装渠道挡住了。

AWS 示范用 AgentCore Evaluations + DevOps Agent 盯生产多智能体:质量分和基础设施要分开看

智能代理
来源:AWS 机器学习博客·
查看原文
事件内容

AWS 于 2026 年 9 月 11 日发文,面向已在 Amazon Bedrock AgentCore 上跑多智能体的团队,用一套航空订票演示说明:生产事故经常看起来像「Agent 变笨」,根因却可能是权限或限流。

  • 两层监控:AgentCore Evaluations 对线上对话抽样,用 LLM-as-a-Judge 打 helpfulness / correctness / goal completion,并解释低分;AWS DevOps Agent 在出事时自动拉 CloudWatch、跨服务追 IAM / Bedrock / 运行时,给出根因与修复建议。
  • 为什么难盯:演示用 Swarm——主管只做入口,专家之间动态交接、共享工作记忆,没有固定调用图可埋点。一次「西雅图→波士顿→迈阿密 + 伴侣券 + 差旅政策 + 金卡升舱」要并行查航线、读会员、再按顺序下单。
  • 怎么接:观测数据从 AgentCore runtime 经 OpenTelemetry 进 CloudWatch;质量分也进同一处。事故可通过签名 webhook 交给 DevOps Agent。完整 CDK 与仪表盘在官方样例仓库,并指向 FAST(Fullstack AgentCore Solution Template)里的 Evaluations 指南。
  • 核对范围:这是官方 how-to 与参考实现,不是新产品发布日。AgentCore Evaluations、DevOps Agent 的区域、采样比例与报价,请打开对应产品页再写进运维手册。
资讯解读

多智能体上线后,最容易误判的是把「质量失败」和「基础设施失败」看成同一件事。AWS 这篇把尺子劈成两把:一把看 Agent 有没有帮用户办成事,一把看 IAM / 限流 / 链路有没有在沉默中坏掉。对已经有 CloudWatch 却仍靠战情室排障的团队,这比再加一块模型分数更值钱。

谁将受益
Agent 平台 / SRE

先在预发抽 5%–10% 流量打质量分,看低分是不是总落在同一种工具选错。基础设施侧则拿一次「空响应」演练,看 DevOps Agent 能不能把它连到缺失的 IAM,而不是只丢一条 500。

业务负责人

看板全绿、订票却变少,往往是路由或提示词漂了,不是服务器挂了。建议把「任务完成率」和「错误率」分成两列周会指标,避免只拿可用性当 Agent 好用的证据。

AWS 给出在 AgentCore 上托管 MCP Apps 的做法:同一套交互卡片可进 ChatGPT 与 Claude

智能代理
来源:AWS 机器学习博客·
查看原文
事件内容

AWS 于 2026 年 9 月 11 日发文,面向要把业务做成「带界面的 MCP 服务」的团队,示范如何用 Amazon Bedrock AgentCore 托管 MCP Apps:在 ChatGPT、Claude 等支持该扩展的宿主里渲染同一套 HTML 卡片,而不是只回纯文本。

  • 协议与平台:MCP Apps 给 MCP 加上可交互 HTML 小组件;AgentCore runtime 提供按会话隔离的无服务器 MCP 宿主,AgentCore Gateway 露出单一安全端点。样例「Unicorn Rentals」可浏览、预订、查看与归还,官方写明在 ChatGPT 与 Claude 里体验一致。
  • 请求怎么走:宿主先 `tools/list` / `resources/list`;用户一句话被译成 `tools/call`(如 `list_unicorns`)。有 `_meta.ui.resourceUri` 的工具会再 `resources/read` 取自包含 HTML,在沙箱 iframe 里渲染。业务逻辑在独立 Lambda + DynamoDB,MCP 层只做协议适配。
  • 生产注意:Gateway 前可加 WAF(IP 白名单、托管规则、限流);runtime 用资源策略只允许 Gateway 角色调用。观测走 CloudWatch;非结构化出站文本可用 Bedrock Guardrails。计费按容器时长与调用量。仓库:`aws-samples/sample-agentcore-mcp-apps`。
  • 核对范围:这是官方教程 + 样例,不是 MCP Apps 标准本身的发布日。ChatGPT 需打开 Developer Mode 并登记插件;Claude 走 Connectors。具体宿主是否已对你的账号开放 MCP Apps,请打开各宿主设置核对。
资讯解读

企业服务要进 AI 宿主,争的不再是「谁先做一个 GPT 插件」,而是「能不能用开放协议把同一套工具和卡片送到多个宿主」。AWS 把协议层做薄、业务留在原有 Lambda,意思很清楚:你该投资的是工具契约和小组件,而不是绑死一家聊天窗口。

谁将受益
要在 ChatGPT / Claude 里露出业务界面的平台团队

先用样例跑通 Gateway URL,再把 Unicorn 的 Lambda 换成你们现有下单/查询接口。建议先做只读查询卡,写操作单独加确认与审计。

云安全 / 平台负责人

无鉴权 Gateway + WAF IP 白名单只适合演示。生产必须把「谁能调 MCP」和「工具参数是否二次校验」写成硬条件,别把样例的 No Auth 直接带进正式环境。

Cursor 上线 Projects:协调智能体可并行拆大功能,关电脑也不停

编程开发
来源:Cursor Changelog·
查看原文
事件内容

Cursor 于 2026 年 9 月 10 日在官方 Changelog 发布 Projects(测试版,即日起向全部用户滚动开放),面向要做大功能、迁移或整站交付的开发团队,用协调智能体把长期任务拆给大量子智能体并行推进。

  • 怎么分工:左侧导航进入 Projects。协调智能体自己不写代码,负责规划、把任务派给执行智能体,再把完成件交回给你验收;可按工作量并行拉起所需数量的子智能体。
  • 云端不停机:Project 跑在独立的云电脑上,合上笔记本也不会中断。需要本机测试时,协调智能体会再拉起本地智能体。
  • 共享上下文:每个 Project 维护一套在云端与本机之间同步的文件,智能体会写入调研、产物,以及它对代码库和你偏好的理解。例如有人摸清了某服务的测试方法,后续智能体都能沿用。
  • 订阅信号:可让协调智能体盯 Slack 频道、按日程跑,或跟踪全部 PR;接到信号就行动,不必等你再提示。接到 Slack 报缺陷频道后,可按每条缺陷自动分派。
  • 核对范围:官方写明为 beta、即日起滚动开放。额度、价格、企业管控与地区可用性请打开 Changelog 原文核对后再写进团队规范。
资讯解读

编码 Agent 的产品形态正在从「开一个对话改一段代码」,变成「给一个可持续数月的项目容器」。真正变的是上下文归属:测试方法、代码库约定和你的口味不再每次重讲,而是沉在 Project 里给后来的智能体复用。先拿一个边界清楚的迁移或缺陷队列试一周,比一上来把整条发布火车交给它更稳。

谁将受益
要做大功能 / 迁移的研发团队

适合把「拆任务 → 并行改 → 人验收」从聊天记录里搬进一个长期容器。建议先选一个已有测试网的模块,看协调智能体分派后的 diff 能不能过你们现有 CI,再决定要不要扩到主路径。

平台 / DevEx

可复用的是「共享上下文 + Slack/PR 订阅」,不是「上千子智能体」这个数字。先把报缺陷频道和主仓库 PR 接到订阅上,统计人工接管率,再谈要不要扩大并行度。

OpenAI 推出 Agents API:托管云端智能体,编排与长会话走 Codex 套件

智能代理
来源:OpenAI 官方博客·
查看原文
事件内容

OpenAI 于 2026 年 9 月 10 日通过官方博客 RSS 发布 Agents API,面向要上线云端智能体的产品与平台团队,把它定位为托管服务,底层由 Codex 套件驱动编排、长会话与工具调用。

  • 官方一句话:用 Agents API 构建并上线云端智能体;托管服务,由 Codex harness 提供编排、长时间运行的会话,以及工具使用。
  • 和「自己拼 Agent 循环」的差别:官方强调的是托管与套件,而不是再发一套提示词模板。适合已经在用 Codex / ChatGPT 工具调用、想把会话和编排交给平台的团队。
  • 核对范围:本次抓取官网正文页被 Cloudflare 拦截,卡片只采用官方 RSS 标题与摘要中的事实。定价、配额、地区、是否对所有 API 层级开放,以及和 Assistants / Responses API 的替换关系,请打开原文核对后再写进架构评审。
资讯解读

智能体竞争已经从「模型能不能调工具」转到「谁把编排、长会话和托管一起交出去」。Agents API 的官方表述就是这条:少自建循环,多把会话寿命和工具调用交给 Codex 套件。落地前先画清你们现有 Agent 循环里哪一段最疼(重连、超时、工具超时),再决定是整段迁还是只把长任务迁过去。

谁将受益
Agent / 平台工程

适合评估「自建循环 vs 托管编排」。建议先拿一条已经能跑通的长任务(过夜批处理或多工具调研)对打现有栈,看会话能否续上、工具失败怎么重试,再谈替换。

要把内部助手做成可上线服务的小团队

官方卖点是少维护基础设施。先确认计费和数据驻留写进合同,再把原型从聊天窗口迁到这条 API,避免只改调用名、不改验收标准。

ChatGPT Work 上线 Data agent:自然语言接公司数据,可出交互仪表盘

商业分析
来源:OpenAI 官方博客·
查看原文
事件内容

OpenAI 于 2026 年 9 月 10 日通过官方博客 RSS 介绍 ChatGPT Work 里的 Data agent,面向要在对话里用公司数据出洞察的业务与分析岗,强调用自然语言连接数据、发现洞察,并搭建交互式仪表盘。

  • 官方定位:Meet the Data agent in ChatGPT Work——连接公司数据,发现洞察,用自然语言搭建交互式仪表盘。
  • 和「把表格贴进聊天」的差别:官方写的是「接上公司数据」再分析、出仪表盘,而不是一次性粘贴一份 CSV。适合已经在用 ChatGPT Work、希望少走一遍 BI 排期的团队。
  • 核对范围:本次抓取官网正文页被 Cloudflare 拦截,卡片只采用官方 RSS 摘要。支持哪些数据源、权限模型、是否写入源系统、定价与企业管控,请打开原文核对后再对财务口径负责。
资讯解读

企业里「问一句出一表」正在被「接上数仓就能出可点的仪表盘」替代。Data agent 的官方表述把入口放在 ChatGPT Work,而不是再买一套 BI。真正要验收的不是界面漂不漂亮,而是口径能不能对上你们现有的指标表——先拿一个你已经知道答案的问题去测。

谁将受益
财务 / 运营 / 分析岗

适合用来缩短「提数 → 等排期 → 再改一版图」的循环。建议先选一个上周刚出过的周报指标,看它连上数据后数字是否对得上,再决定能不能替代临时看板。

数据与安全负责人

官方只说「连接公司数据」,没在 RSS 里写清驻留和审计。接入前先核数据源白名单、行级权限和导出范围,避免业务侧自己连上生产库。

Amazon Quick 桌面端正式 GA:Mac/Windows 可委派事务,手机只留要你拍板的事

办公增效
来源:AWS 机器学习博客·
查看原文
事件内容

AWS 于 2026 年 9 月 10 日宣布 Amazon Quick 桌面应用在 macOS 与 Windows 正式 GA,面向企业知识工作者;同期给 iOS / Android 增加活动流,把邮件、日历、CRM 与即时消息收成一份按优先级排列的清单。

  • 桌面能做什么:用自然语言问复杂问题、在后台组装会议简报,并把一个人搭好的仪表盘、智能体与自动化分享给全组。官方强调数据留在客户环境、对话保持私密,审计走 Amazon CloudWatch 与 AWS CloudTrail。
  • 手机活动流:智能体自己能处理的事项从列表里消失,剩下「只有你能拍板」的短队列;会学习关系、优先级与习惯,而不是只按到达时间刷屏。
  • 合规与预览客户:官方写明从第一天起带 HIPAA、FedRAMP、SOC 2、ISO 27001。Southwest Airlines、LabCorp、PGA TOUR 等在预览期使用桌面端,原文引用了他们的内部评价,属客户证言,不是可复现基准。
  • 不是二手转述:这是 AWS 自有助手产品的桌面 GA,不是在转述另一家模型上架。
资讯解读

企业助手要过 IT 这一关,靠的不是更会聊天,而是「数据不出环境 + 审计齐 + 手机只推需要人拍板的事」。Quick 把桌面 GA 和活动流绑在一起卖的就是这条:日常组装交给智能体,判断留给你。先拿一场你自己能核对的客户会预演,看简报口径对不对,再谈全公司铺开。

谁将受益
客户成功 / 销售 / 项目经理

适合用来把「会前扒邮件和 CRM」压成一条指令。建议先对一场你已经手写过简报的会议,对照 Quick 出的版本缺不缺关键数字,再决定要不要改会前习惯。

企业 IT / 安全

官方把 HIPAA / FedRAMP / SOC 2 / ISO 27001 和 CloudTrail 审计写进 GA 声明。接入前仍要核数据驻留区域、身份源和影子 AI 替代范围,不要把预览客户证言当成你们的合规证明。

SageMaker Inference 上线前缀感知路由:同前缀请求打到同一实例,P50 首字延迟最高降 77%

算力与基建
来源:AWS 机器学习博客·
查看原文
事件内容

AWS 于 2026 年 9 月 10 日为 Amazon SageMaker Inference 实时端点新增 PREFIX_AWARE 路由策略,面向已在实例上打开前缀 KV 缓存的 LLM 服务团队,让带相同提示词开头的请求稳定打到同一台机器。

  • 要解决的错位:vLLM / TensorRT-LLM 能缓存共享前缀,但默认随机路由会把同一段 3000 token 系统提示打散到整个机群,每台都冷启动。新策略按请求开头做亲和,并带过载保护:目标实例满了就改道,扩缩容时只挪一小部分流量。
  • 官方基准(Llama 3.1 70B Instruct,7 台 ml.p5.48xlarge,vLLM 打开前缀缓存):8000 token 共享前缀、持续 1 小时时,P50 TTFT 降 71–77%,P90 降 33–37%,KV 缓存命中率从约 25% 升到逾 80%,吞吐升 15–16%。短对话(ShareGPT 风格 30 分钟)P50 降 13–16%,吞吐只升约 2%。路由本身多 1.3–1.9 毫秒。
  • 怎么开:在端点配置的 RoutingConfig 里设 RoutingStrategy=PREFIX_AWARE,并配置 PrefixLength(1024–65536)与 ConcurrencyThreshold(1–1024)。原生 Invoke 按请求体字节计,OpenAI 兼容 API 按抽出的消息字符计;多租户可用 X-Amzn-SageMaker-Prefix-Aware-Id 或 prompt_cache_key 做隔离。
  • 前提:至少两台实例,且容器侧必须打开前缀缓存。单实例或请求序列化不一致(JSON 空格、键顺序)会让亲和失效。
资讯解读

推理优化已经从「模型里再压一点」走到「路由层别把缓存打散」。共享系统提示、RAG 同一篇文档、多轮历史越长,前缀感知越值钱;短闲聊几乎看不出吞吐变化。先量你们请求开头的真实重合度,再改 RoutingStrategy,比先改实例型号更便宜。

谁将受益
已在 SageMaker 上跑 LLM 的推理负责人

适合 RAG、模板机器人、同一文件上的补全。建议先在预发打开详细可观测性,对同一文档的 100 次问答看 KV 命中率有没有从两成爬到八成,再改生产。

平台 / 成本优化

官方数字来自 Llama 3.1 70B + p5 机群,不是你们的模型。先用现有前缀长度估 PrefixLength,并统一序列化,避免「看起来同一条提示、字节对不上」把流量打散。

Anthropic 发布 2026 年 9 月威胁报告:点名通义、Kimi、DeepSeek 的工业化蒸馏

安全与治理
来源:Anthropic 官方威胁情报·
查看原文
事件内容

Anthropic 于 2026 年 9 月 10 日发布《Detecting and countering misuse of AI: September 2026》,汇总 2025 年 12 月至 2026 年 8 月、由其威胁情报团队识别并打断的滥用,覆盖网络攻击、影响力行动、监控、诈骗、生物误用、常规武器与蒸馏七类。官方写明:除一起非法蒸馏外,这些案例用的是 Claude Haiku / Sonnet / Opus,不涉及 Fable / Mythos。以下数字与归因均为 Anthropic 单方叙述;通义、Kimi、DeepSeek 官网近 24 小时未见带日期回应。

  • 网络攻击趋势:官方称 AI 已压低「国家队 vs 个人」的技能门槛,多数案例里模型不只回答问题,而是编排侦察、利用与窃取;人仍决定目标并复核结果。报告举俄罗斯关联 GTG-20006 等案例,说明检测规则被绕过的速度在加快。
  • 非法蒸馏(官方定义):工业化、隐蔽地抽取模型能力并复制到另一模型,通常靠被盗信用卡、账号与 API Key。阿里巴巴(通义实验室 / Qwen):Anthropic 称为其测过最大的思维链蒸馏,针对 Opus 4.6 / 4.7,用于 Qwen 3.5 / 3.6 / 3.7;2026 年 5–7 月归因逾 1.51 亿 次交互,峰值近 300 万次/天、逾 3500 个欺诈账号。月之暗面:官方称其曾把用户请求悄悄转到 Claude(多数打到 Opus)再把回复显示为 Kimi,并抽取思维链;5–7 月归因逾 2300 万 次,其中 10 天内近 30 万次、约 5380 个账号。DeepSeek:官方称其用类似跨会话回放拆出推理痕迹,并在第三方编码套件流量上把部分用户转到 Opus;2026 年 7 月 14 天内归因逾 1210 万 次。
  • 边界:这是厂商威胁报告,不是法院判决或被点名公司的承认。能力、定价、产品是否上线不在本报告范围内;亦见于 TechCrunch 对同一份报告的转述。
资讯解读

蒸馏已经从「抠几条思维链」变成「百万到亿级账号池 + 跨会话回放」。对用国内模型做办公的团队,风险不只是「模型像不像 Claude」,而是「你以为在和 Kimi / DeepSeek 说话,请求可能被转到另一家」。在被点名方公开回应之前,应把这份报告当成需要交叉验证的指控,同时检查你们的第三方路由和 API Key 有没有被当成蒸馏管道。

谁将受益
安全 / 威胁情报 / 法务

可把「欺诈账号池、固定抽思维链提示、跨会话回放推理签名」写成检测规则草稿。建议对照你们自己的 API 日志看有没有同类固定前缀,而不是直接把点名写进对外稿。

使用通义 / Kimi / DeepSeek 或第三方路由的企业

在厂商回应之前,先核隐私政策和数据处理位置,敏感对话尽量走已签合同的企业端点。不要把 Anthropic 的归因当成已证实的客户数据泄露清单。

Hugging Face 用 Gradio Workflow 重做 AUTOMATIC1111:73 个节点可当 API 与 MCP 用

图像创作
来源:Hugging Face Blog·
查看原文
事件内容

Hugging Face 于 2026 年 9 月 10 日发文介绍 Workflow1111:用 Gradio Workflow 把 AUTOMATIC1111 稳定扩散 WebUI 的大部分能力收成一张工作流画布,面向要在浏览器里拼出图管线、又想直接当 API 调用的团队。

  • 画布上有什么:11 条媒体管线、73 个节点,覆盖文生图、高清修复、图生图、提示词矩阵、VLM 反推、检测转重绘蒙版、ControlNet 风格标注、去背、PNG Info、图生视频等。节点只有四类:本地 Python 函数、InferenceClient 调模型、调用另一个 Space、读 Hub 数据集。
  • 怎么跑:用 Hugging Face 账号登录或提供 access token,模型调用走你自己的配额。也可复制 Space 改线。约三分之二节点是纯本地 fn(36 个算子里 32 个 fn、22 个完全不联网)。
  • 每个输出都是接口:官方写明画布上的输出节点会生成 REST 端点(文中列举 /image、/edited_image、/png_info 等 9 个),打开 mcp_server=True 后也可当 MCP 工具;调用方在 X-HF-Token 里带自己的 token,Space 不代持密钥。
  • 和 ComfyUI 的官方对照:节点可以跑在你没有的硬件上(Inference Providers / Space);自定义节点就是普通 Python 函数。这是 Gradio 工作流示例,不是 AUTOMATIC1111 官方迁移公告。
资讯解读

出图工作流的交付物正在从「一个只能点的 WebUI」变成「画布 = 类型化 API」。Workflow1111 真正可抄的是「输出节点自动变 REST / MCP」,而不是把 73 个节点原样搬进生产。先复制 Space、只留你们常用的文生图 + PNG Info 两条线,比在本地复刻整张 AUTOMATIC1111 更快验证。

谁将受益
已有 A1111 / ComfyUI 习惯的出图同学

适合用来验证「同一套管线能不能被 Agent 当工具调」。建议先用官方 Space 跑一张你们品牌参考图,再决定要不要 Duplicate 后换成自己的 checkpoint。

要给内部助手接出图能力的工程

可复用「输出即端点 + 调用方自带 HF Token」。先把 /image 接到现有 MCP 客户端看超时和配额,再谈要不要把检测、去背也接进来。