PDI Brew:非技术人员用英文描述,秒得可上线多租户Web应用|AI落地与Agent

有人把整套报关流程交给了 Agent,人只签字;今天这家公司的员工,只要说一句‘我要个审批表’,系统就自动部署好带权限、带审计的 Web 应用——真正在用 Agent 改写 IT 交付链。

▍今日主打

Prime Intellect开源Prime Agent:子Agent即函数调用,IPython内核持久化支持自我迭代

PDI Technologies 开发的 PDI Brew 是一个典型的「低代码+Agent」生产级落地案例:它不是演示玩具,而是已投入内部使用的 agentic 平台。核心逻辑是——用户输入自然语言(如‘做一个销售合同审批表,需部门负责人和法务双签,留痕存档’),系统通过 Amazon Bedrock 的规划 Agent 拆解意图,再调用 AWS Lambda 构建 Provisioning Agent,自动完成前端页面生成、后端 API 部署、IAM 权限配置、CloudWatch 监控埋点、多租户隔离等全套动作,全程数秒完成,且所有资源受企业级治理策略约束。

这对想落地 AI 自动化的企业意味着:IT 部门不再卡在需求排队、排期开发、上线测试的长链条里;业务人员可自主发起轻量级工具建设,而安全与合规由 Agent 内置策略兜底。开发者则能复用其「可插拔 Planner + 专用 Provisioning Agent」架构,将类似能力迁移到采购申请、报销单、工单系统等高频场景。

判断:适合已有 AWS 基础设施、希望释放业务侧生产力的中大型企业。小团队不必自建,但可直接抄其模式——先锁定一个重复率高、规则明确、无强定制的流程(如差旅报销),用 Bedrock AgentCore + Lambda 封装成「一句话生成」服务,验证闭环后再扩展。

—— 以下是今天的全部 15 条速览 ——

Agent 与流程自动化

1. AWS发布Bedrock AgentCore新能力:时序策略+网关限流,控住Agent行为与成本

Amazon Bedrock AgentCore 新增 Temporal Policies(时序策略),支持基于会话历史做动态鉴权,例如强制要求‘先查库存→再下单→最后人工确认’的流程顺序;

Gateway 层新增细粒度限流:可按 JWT 用户身份或 IAM 角色,分别限制每秒请求数、Token 消耗量、并发连接数;

两项能力均基于新开源策略语言 Dogwood,让企业能在不修改 Agent 代码的前提下,对复杂行为链做确定性管控。

号哥说:这不是功能堆砌,而是直击 Agent 落地最大痛点:失控。当 Agent 能调用支付、数据库、API 时,‘让它干’和‘让它安全地干’是两回事。Temporal Policies 把风控从单点校验升级为流程级守门员,特别适合金融、采购、客服等强流程行业。

落地提点:想上 Agent 的公司,别急着堆模型,先配好 AgentCore 的 Temporal Policies——它才是你敢把审批、下单交给 AI 的底气。

AWS Machine Learning Blog · 阅读原文


2. AWS用OpenTelemetry+CloudWatch监控Codex编码Agent,看清谁在用、花多少、稳不稳

工程团队采用 Codex 类编码 Agent 后,缺乏统一视图追踪使用情况、资源消耗与稳定性;

新方案通过 OpenTelemetry Collector 将 Codex 的指标(如调用次数、token 用量、失败率)路由至 Amazon CloudWatch;

实现按用户、团队、成本中心维度聚合分析,并与 AWS 成本管理器联动,量化每个 Agent 的 ROI。

号哥说:Agent 不是黑盒,必须可观测。该方案把‘AI 工程师用了多少 token’‘市场部写的脚本成功率多少’变成可报表、可归因的数据,解决了管理层最关心的‘值不值’问题,也为后续扩缩容提供依据。

落地提点:刚上线 Agent 的团队,第一周就要接监控——不是为了炫技,是为了下次向老板要预算时,能指着图表说‘这组 Agent 省了 3.2 人天/周’。

AWS Machine Learning Blog · 阅读原文


3. AWS推出Claude Code单Region部署方案,满足金融/政务客户数据不出境硬要求

某受监管客户要求 Claude Code 所有推理必须严格限定在伦敦单一 AWS Region,而非仅地理就近;

方案提供两种技术路径:1)应用级 Inference Profile + IAM Region 条件策略;2)Mantle endpoint + CloudTrail 审计验证;

实测可 100% 锁定流量路径,并通过 CloudTrail 日志自动稽核合规性。

号哥说:数据驻留不是口号,而是可验证的技术栈。该方案绕开了传统‘区域白名单’的模糊地带,给出精确到 endpoint 和 IAM policy 的落地方案,对银行、政府、医疗等强合规行业极具参考价值。

落地提点:做跨境业务或受监管行业的,别只盯着模型性能——先看清楚你的 Agent 数据能不能锁死在一个 Region,这是上线前提。

AWS Machine Learning Blog · 阅读原文


4. AWS开放Agent Skills开源套件:让编码Agent全自动跑完策略全生命周期

Agent Skills 是一套开源工具集,支持编码 Agent 自动完成 Automated Reasoning Policy 的构建、评审、测试、调试、部署与验证;

覆盖从政策文本解析→逻辑冲突检测→沙箱仿真→灰度发布→效果回溯的完整链路;

将原本需专家在控制台手动操作的政策管理,转化为可版本化、可 CI/CD 的工程化流程。

号哥说:Policy 即代码(Policy-as-Code)的 Agent 版实践。它把合规、风控、审计等原本依赖人工的‘软性规则’,变成可被 Agent 自动执行、验证、迭代的‘硬性流程’,大幅降低企业治理成本。

落地提点:法务、风控、安全部门的同事注意:这套 Agent Skills 不是给程序员用的,是给你们的——以后改一条审批规则,不用等开发排期,自己提 PR 就行。

AWS Machine Learning Blog · 阅读原文


5. ScaleX发布AI Agent权限审计报告:人类审核员漏掉33%风险指令,4万次游戏测试暴露授权盲区

ScaleX 在 40,000 次模拟 Agent 执行任务的游戏中,统计人类审核员对 Agent 请求的批准率;

结果发现:33% 的高风险操作(如删除文件、转账、修改权限)被误批,主因是请求表述模糊或上下文缺失;

报告指出当前‘人工审批+静态权限’模式已跟不上 Agent 多步协作的复杂度。

号哥说:这份数据戳破了一个幻觉:以为加个‘确认弹窗’就等于可控。它证明 Agent 的风险不在单点,而在状态迁移中——比如‘查账户余额’之后紧接着‘发起转账’,需要关联判断。这才是 Temporal Policies 的真实战场。

落地提点:还在靠弹窗让人点‘确定’?赶紧换成 Temporal Policies——它能记住‘你刚查过余额,现在又要转钱’,这才是真风控。

Hacker News · 阅读原文


AI 工具 · 实测上新

1. Cloudflare发布Kitesurf:专为AI Agent打造的无Chromium轻量浏览器,运行在V8隔离环境

Kitesurf 是首个完全抛弃 Chromium、纯 Rust 编写的 Agent 专用浏览器,运行于 Cloudflare Workers 的 V8 Isolate 中;

移除标签页、插件、渲染引擎等人用功能,专注输出结构化 HTML/JSON、支持 JS 执行、保证进程级隔离;

实测启动快 10 倍、内存占用降 75%,且天然防 XSS 与跨域污染。

号哥说:这不是浏览器,而是 Agent 的‘网页阅读器 SDK’。它解决了 Agent 爬网页时长期面临的难题:Chromium 太重、太慢、太不可控。Kitesurf 让 Agent 能像调 API 一样调用网页,且成本可控、安全可信。

落地提点:做网页自动化 Agent 的开发者,立刻试 Kitesurf——告别 Selenium 和 Puppeteer,你的爬虫延迟能从秒级降到毫秒级。

MarkTechPost · 阅读原文


2. Prime Intellect开源Prime Agent:子Agent即函数调用,IPython内核持久化支持自我迭代

Prime Agent 基于 Recursive Language Model(RLM)架构,将子 Agent 调用编译为 IPython 内核中的 Python 函数;

Continual Harness 允许 Agent 在运行中实时编辑自身 prompt、技能库、记忆机制甚至子 Agent 定义;

在 ARC-AGI-3 测试中达 95.5% RHAE Best@1,显著优于同类开源框架。

号哥说:它把‘Agent 自我进化’从概念拉进工程现实:不是靠外部训练,而是靠内核级状态持久化+运行时代码重写。适合研究型团队快速验证新 Agent 范式,但生产环境需谨慎评估稳定性。

落地提点:想学 Agent 架构的开发者,别从 LangChain 开始——先跑通 Prime Agent,你会真正理解什么叫‘Agent 是活的程序’。

MarkTechPost · 阅读原文


3. SageMaker Python SDK v3集成LLM优化推荐:笔记本内一键比对、选型、部署最优推理配置

新版 SageMaker Python SDK 在 Jupyter Notebook 中原生集成 LLM 推理性能分析模块;

用户上传模型或指定 endpoint,SDK 自动运行负载测试,对比吞吐、延迟、成本,生成数据驱动的部署建议;

支持一键应用推荐配置(如量化精度、batch size、实例类型),无需跳转控制台。

号哥说:把 MLOps 中最耗时的‘调参试错’环节,压缩成 notebook 里一个 .recommend() 方法。对中小团队尤其友好——省去搭建压测平台的成本,让模型工程师专注业务逻辑。

落地提点:还在手动改 config.yaml 测 LLM 性能?升级 SageMaker SDK v3,把压测变成 notebook 里的一行代码。

AWS Machine Learning Blog · 阅读原文


4. Meta开源Muse Spark 1.2与Muse Code:面向超大代码库的Agent框架,支持断点续执行

Muse Spark 1.2 是 Meta 新一代编码 Agent 运行时,专为百万行级代码库设计;

Muse Code 是其配套 Agent,具备‘崩溃后自动恢复到断点’能力,避免长任务中断重来;

底层强化 long-context 工具调用与跨文件符号索引,GitHub 上已开源核心组件。

号哥说:这不是又一个 Copilot,而是针对企业级代码仓库的 Agent OS。‘断点续执行’解决的是真实研发场景痛点——审阅 2000 行 diff 时崩了,不用重头来。对 DevOps 团队有极强迁移价值。

落地提点:管着几十个微服务仓库的 Tech Lead,Muse Code 值得你下周就拉团队试跑——它的‘崩溃不丢进度’,比任何新功能都实在。

TechCrunch AI · 阅读原文


5. Microsoft SkillOpt证实:Agent技能可跨模型、跨框架迁移,Codex训练的技能让Claude Code提效2.7倍

SkillOpt 实验显示,一个在 Codex 上训练的 SpreadsheetBench 技能,迁移到 Claude Code 后准确率从 22.1% 提升至 81.8%;

技能迁移不依赖模型微调,仅靠 skill.md 文件导出导入即可生效;

不同任务类型迁移效果差异大,表格类最佳,代码生成类次之,数学推理类保留率较低。

号哥说:这意味着企业未来可建立‘技能资产库’:一次开发,多模型复用。避免为每个新模型重训技能,大幅降低 Agent 运维成本,也加速了技能市场的形成。

落地提点:别再为每个模型单独写 Tool Call 了——把技能写成标准 skill.md,今天 Codex,明天 Claude,后天 Qwen,都能直接用。

MarkTechPost · 阅读原文


行业 AI 落地

1. Omilia获6700万美元B轮融资,加速AI客服平台在金融与保险业规模化落地

Omilia 客服平台已服务 30+ 家银行与保险公司,平均将首次响应时间从 45 秒降至 3.2 秒;

新资金将用于扩展多语言对话理解、强化合规话术引擎(如 GDPR、CCPA)、接入更多核心业务系统;

客户案例显示,其 Agent 可自动处理 78% 的保单查询、理赔初审、反欺诈线索识别等结构化任务。

号哥说:客服不是‘聊天机器人’,而是业务入口。Omilia 的价值在于把 NLU、流程引擎、系统对接、合规校验打包成开箱即用的 Agent,让银行能把‘查余额’‘改地址’‘报理赔’这些高频动作真正甩给 AI。

落地提点:银行/保险IT负责人注意:别再买‘能聊’的客服系统了——直接找 Omilia 这类已打通核心系统的 Agent 厂商,省下 6 个月对接时间。

TechCrunch AI · 阅读原文


2. Ex-Spotify团队融资1000万美元,将推荐AI从音乐迁移到电商:预测用户‘下一个想买什么’

新创公司复用 Spotify 十年积累的协同过滤+实时行为建模技术,构建电商推荐 Agent;

平台可预测单品级购买意向(非品类),并根据用户实时点击/加购/停留行为动态调整推荐序列;

早期客户数据显示,其 Agent 将客单价提升 19%,购物车放弃率下降 27%。

号哥说:这不是‘猜你喜欢’,而是‘预判你要买’。它把推荐从被动响应升级为主动引导,且模型轻量化适配中小电商——不需要自建 PB 级用户行为库,API 接入即可启动。

落地提点:中小电商品牌运营同学,别再纠结‘怎么写文案’——先把这家的推荐 Agent 接上,让 AI 告诉你用户下一步最可能点哪个按钮。

TechCrunch AI · 阅读原文


3. Naïve获2850万美元融资,目标是自动化公司设立与日常运营的全部行政流程

Naïve 平台覆盖公司注册、银行开户、税务登记、HR 系统初始化、合规申报等 37 个行政节点;

用户输入行业、规模、所在地,Agent 自动生成全套法律文件、同步对接政府系统、预约线下认证;

已在美国 12 州上线,平均将创业公司行政筹备周期从 21 天压缩至 3.8 天。

号哥说:行政不是‘后台支持’,而是业务启动瓶颈。Naïve 把律师、会计、代办机构的 SOP 拆解为可编排的 Agent 流程,对跨境电商、SaaS 创业者尤其关键——早一天上线,就早一天收钱。

落地提点:准备创业的老板,别急着写BP——先用 Naïve 跑一遍公司注册流程,看看哪些环节还能砍掉,这才是真实启动成本。

TechCrunch AI · 阅读原文


4. Google Maps上线Agentic功能:语音点餐、酒店预订、行程规划全由AI代理完成

用户对 Google Maps 说‘订今晚 7 点三里屯附近人均 300 左右的川菜,顺便帮我约车’,Agent 自动完成餐厅筛选、预订、叫车、同步日历;

背后整合了 200+ 本地服务商 API,Agent 动态协商价格、处理库存冲突、回退备选方案;

初期覆盖美、英、日、韩四国,订单履约率达 92.4%,平均节省用户操作步骤 8.3 步。

号哥说:地图 App 变身生活 Agent,本质是把分散的服务商 API、用户意图、实时状态(如餐厅排队、网约车空闲)封装成可信赖的执行单元。对本地生活平台是警钟,也是范本。

落地提点:本地生活服务商老板,别只想着上团购——赶紧把你的 API 接口文档喂给 Agent 平台,否则下次用户点餐,你的店根本不会出现在 AI 的备选列表里。

TechCrunch AI · 阅读原文


5. Hadrian获13.7亿美元融资,用AI Agent驱动全自动工厂生产军用部件

Hadrian 构建端到端 AI 制造系统:Agent 解析图纸→调度数控机床→视觉质检→物流排程→数字孪生反馈;

首条产线已量产潜艇声呐罩部件,良品率较人工产线提升 11%,单件成本下降 34%;

其 Agent 核心能力是‘物理世界异常决策’——如材料微缺陷时自动切换加工参数,而非停机报修。

号哥说:制造业 AI 不是替代工人,而是赋予机器‘思考物理规律’的能力。Hadrian 的 Agent 已超越软件层,深入到材料应力、热变形、刀具磨损等硬约束决策,代表工业 AI 的真正前沿。

落地提点:制造企业技术总监,别只关注大模型——去研究 Hadrian 的‘物理异常决策 Agent’,那才是让你产线真正抗波动的关键。

TechCrunch Transportation · 阅读原文

———— 关于我们 ————

「号哥聊AI」专注 AI 落地:帮企业把重复、跨系统的流程做成 AI Agent(采购、客服、单据、报表……)。

· 想让公司某个流程自动化 —— 在本号【发消息回复「自动化」】,我们帮你看看能怎么落地;

· 想学 Agent 开发 / AI 工具 —— 关注本号,每天更新。

本文为 国外最新的AI资讯摘要与点评,非原文转载;版权归原作者所有,点击链接可读原文。


📚 往期回顾

Similar Posts