AWS发布Bedrock AgentCore+SM AI多Agent工作流方案|AI落地与Agent

有人把采购、客服、单据审批全交给了Agent,人只签字——这不是科幻,是AWS刚发布的可落地方案。

▍今日主打

AWS发布Bedrock AgentCore+SM AI多Agent工作流方案

AWS这篇技术博客首次系统展示了如何用Bedrock AgentCore运行时 + SageMaker AI自托管模型,构建真正可分工协作的多Agent工作流:比如一个Agent专做合同条款比对(调用微调过的Qwen 3.8),另一个负责生成合规报告(调用Claude 4),第三个执行审批流程(集成内部OA API)。关键突破在于它解决了企业最头疼的‘黑盒不可控’问题——通过SageMaker端点实现token级可观测性,能精准定位是哪个Agent在哪一步调用了哪个工具、返回了什么、耗了多少token。

这对想落地AI自动化的企业意味着:不用再赌一个‘全能Agent’,而是按岗位/流程拆解任务,让每个Agent各司其职;对开发者而言,这是目前最接近生产环境的多Agent架构实操指南,所有代码、配置、监控链路都开源可复现。它绕开了LangChain等通用框架的抽象陷阱,直接基于AWS成熟服务栈构建,部署成本和运维复杂度大幅降低。

判断:适合已有SageMaker使用经验、且业务流程明确分段(如采购→法务→财务)的中大型企业;小团队可先拿其中一段(如自动填单)做PoC验证。别急着全盘替换,先让Agent干好一件事,再逐步串联——这才是AWS方案真正想传递的务实逻辑。

—— 以下是今天的全部 15 条速览 ——

Agent 与流程自动化

1. AWS发布Bedrock AgentCore+SM AI多Agent工作流方案

AWS官方博客详解如何组合Amazon Bedrock AgentCore与SageMaker AI托管模型,构建多Agent协同工作流,每个Agent可调用最适合其任务的专用模型(如Qwen 3.8处理中文合同、Claude 4生成报告)

方案支持token级可观测性,能追踪每个Agent在每一步调用的工具、输入输出及token消耗,解决Strands等Agent框架默认不支持深度监控的问题

该架构已用于客户实际场景:某跨境电商将采购申请、供应商比价、法务条款审核、财务付款审批四环节拆分为四个Agent,全流程平均耗时从3.2天压缩至47分钟

号哥说:这是目前最贴近企业真实IT架构的Agent落地路径——不依赖新框架,而是复用企业已有的SageMaker模型托管能力+Bedrock统一Agent运行时,规避了‘为AI重写全部系统’的风险。尤其适合已有模型微调经验、且流程环节清晰可拆分的公司。

落地提点:别一上来就想做个‘万能Agent’,先把你公司里最重复、最耗人、最怕出错的那个环节(比如报销单初审)交给一个专用Agent跑通,再横向复制。

AWS Machine Learning Blog · 阅读原文


2. Anthropic用Claude Code实现每日代码维护,合并率达46%

Anthropic正用自家Claude Code Agent自动执行日常代码维护任务,包括崩溃模糊测试、死代码清理、单元测试补全等

在几周内,该Agent共创建388个Pull Request,其中179个被工程师直接合并,合并率达46%,显著高于人工PR平均22%的合并率

该实践表明:Agent并非只能做‘辅助写作’,在工程闭环中已能承担真实交付压力,且因熟悉内部代码库和规范,产出质量更可控

号哥说:这是少有的、有明确数字支撑的Agent工程落地案例——不是演示Demo,而是真正在生产环境跑通CI/CD链条。它验证了‘领域专用Agent+内部知识注入’的威力:比起通用大模型,一个懂你代码风格、API文档、部署流程的Agent,更能扛起实际交付。

落地提点:技术团队想试Agent,别从写文档开始,直接让它帮你修Bug、补测试、删无用代码——效果立竿见影,工程师也更容易接受。

The Decoder · 阅读原文


3. 研究质疑‘自主AI科研’可行性,指出当前Agent仍严重依赖人类设定目标

一项新研究系统分析了Anthropic与OpenAI宣称的‘AI自主科研’进展,发现所有所谓‘自主发现’均建立在人类预设极强约束条件下

实验显示:当移除人类设定的目标函数、评估指标或搜索空间限制后,Agent产出结果随机性陡增,无法稳定复现科学结论

该研究提醒业界:当前Agent本质仍是‘高级工具链’,其‘自主性’高度依赖人类对问题边界的精确框定

号哥说:这则研究给过热的‘Agent取代研究员’叙事泼了冷水,但对务实从业者反而是利好——它划清了能力边界:Agent擅长在明确定义的规则内高效执行(如自动查专利、比对文献、生成实验报告),但不擅长定义‘该研究什么’。企业落地时应聚焦前者,而非空谈‘替代专家’。

落地提点:别让Agent去‘想课题’,让它去‘查1000篇论文并标出矛盾点’——这才是它今天真正能干好的事。

The Decoder · 阅读原文


4. Amazon Nova Forge支持自定义多轮强化学习奖励函数

AWS推出Nova Forge新功能,允许开发者为多轮对话/任务型Agent设计复合式奖励函数,例如将‘代码正确性’‘安全性’‘执行效率’分别赋权并动态加权

平台内置安全沙箱,可安全执行Agent生成的代码进行实时验证,并将结果反馈至奖励计算模块

该能力使Agent训练不再依赖单一准确率指标,而是能对‘完成任务的全过程质量’建模,尤其适用于需多步决策的复杂流程(如故障排查、供应链调度)

号哥说:多轮任务的奖励设计一直是Agent落地最大瓶颈之一。Nova Forge这次把‘怎么定义好结果’这个玄学问题,变成了可配置、可调试、可沙箱验证的工程模块。对制造业、能源等强流程行业,这意味着Agent终于能学会‘怎么一步步把事情办妥’,而不仅是‘最后答对没’。

落地提点:做审批流、工单流、排程流的团队,立刻试试Nova Forge的复合奖励——它能让Agent学会‘走对路’,而不只是‘到终点’。

AWS Machine Learning Blog · 阅读原文


5. Kog创业公司挑战GPU不适用Agent论,提出深度推理优化方案

法国初创公司Kog发布新推理引擎,声称可在消费级GPU上实现Agent多步骤推理的低延迟调度,打破‘GPU只适合单次大模型推理’的固有认知

其技术核心是‘状态快照+增量缓存’:将Agent每步推理的中间状态压缩存储,后续步骤仅加载差异部分,内存占用降低63%

初步测试显示,在RTX 4090上运行5步工具调用Agent,端到端延迟稳定在820ms以内,满足客服、审批等实时交互场景需求

号哥说:这则消息直击Agent落地的硬件痛点——很多企业卡在‘买不起A100集群’。Kog的方案证明:用好现有GPU,比堆算力更关键。它不追求单步更快,而是让多步连贯执行更稳,这对预算有限但想快速上线Agent的中小企业极具参考价值。

落地提点:别急着升级显卡,先看看你的Agent是不是在反复加载/卸载模型——Kog的思路,可能让你手头的4090立刻变‘Agent友好’。

TechCrunch AI · 阅读原文


AI 工具 · 实测上新

1. Cactus Compute发布Needle 2:45M参数开源Tool-Calling模型,14MB二进制即跑

Cactus Compute开源Needle 2,一个仅45M参数的轻量级Tool-Calling模型,完整模型打包为单个14MB二进制文件

该模型可在无GPU、无NPU的嵌入式设备(如树莓派5)上运行完整会话,内存占用仅约28MB,支持设备控制与结构化信息抽取

在Seal-Tools基准测试中,Needle 2超越同尺寸竞品,尤其在‘调用硬件接口’和‘多步骤指令解析’任务上表现突出

号哥说:这是目前最‘接地气’的Agent工具调用模型:不拼参数规模,专注在资源受限环境下可靠调用真实工具。对IoT厂商、边缘计算团队、教育机器人开发者,它意味着可以用极低成本让设备‘听懂人话并动手干活’。

落地提点:做硬件集成、边缘Agent或教学项目的,立刻下载Needle 2跑个demo——14MB大小,比一张高清图还小。

MarkTechPost · 阅读原文


2. Z.ai发布GLM-5.3:无需重训基座模型,靠后训练提升复杂编码能力

Z.ai发布GLM-5.3,未改动743B GLM-5.2基座模型,所有性能提升均来自后训练阶段:扩大长周期任务环境、增加环境类型、延长训练时长

在Terminal-Bench 3.0测试中得分从4.6跃升至28.3,DeepSWE v1.1从46.2升至66.9,网络安全专项CyberGym达84.5%

该模型特别适合需要‘长思考链’的编程场景,如重构遗留系统、编写跨模块集成代码、生成安全审计报告

号哥说:GLM-5.3的价值不在参数量,而在它证明了一条更经济的Agent进化路径:用高质量、长周期的任务数据‘喂养’现有大模型,就能显著提升其工程闭环能力。对开发AI编程助手的团队,这比盲目追大模型更有实操价值。

落地提点:想让Agent写代码?别只盯着模型大小,先看看你有没有足够多的真实开发任务数据来‘喂’它。

MarkTechPost · 阅读原文


3. Writer推出新AI模型与升级版‘Harness’,显著降低Token成本

Writer基于Z.ai开源模型GLM-5.2开发新变体,主打‘部署就绪’与低成本,宣称同等效果下Token消耗降低40%

其升级版Harness系统提供细粒度成本控制:可按用户角色、项目类型、内容敏感度设置不同模型路由策略与token配额

该方案已接入多家媒体客户内容生产管线,将编辑初稿生成环节的单位成本从$0.12降至$0.07

号哥说:Writer这次没卷性能,而是直击企业付费痛点——Token成本。Harness的‘策略路由’能力,让企业能像管理水电一样管理AI使用:重要客户用高配模型,内部草稿用轻量版,敏感内容自动触发审核流。这才是SaaS产品该有的工程思维。

落地提点:做内容、客服、销售文案的团队,重点看Harness的路由策略——它能把AI成本管得比Excel还细。

TechCrunch AI · 阅读原文


4. Simon Willison发布llm-gemini 0.33插件,支持Gemini 3.7 Flash

知名开发者Simon Willison更新llm-gemini命令行插件至0.33版,正式支持Google最新发布的Gemini 3.7 Flash模型

该插件允许开发者在本地终端直接调用Gemini API,支持流式响应、上下文管理、历史记录回溯等功能

作为轻量级工具,它不依赖复杂框架,适合快速验证Prompt、批量处理文本、或集成进脚本工作流

号哥说:这不是一个新模型,而是一个‘让Gemini 3.7 Flash立刻能用’的实用管道。对开发者而言,价值在于省去了自己写API封装的时间;对企业技术团队,它提供了零成本试用新模型的入口——尤其适合做A/B测试、Prompt工程或自动化文档处理。

落地提点:别急着换框架,先用llm-gemini 0.33在命令行里跑通Gemini 3.7 Flash——5分钟搞定,效果立见。

Simon Willison · 阅读原文


5. DeepSeek发布Harness开发者预览版,提供模型即服务(MaaS)管控平台

DeepSeek开源Harness预览版,一个面向企业的模型即服务(MaaS)管控平台,支持多模型统一接入、用量监控、权限分级与成本分摊

平台提供可视化仪表盘,可按部门、项目、用户组追踪Token消耗、API调用频次与错误率,并支持导出详细账单

该工具旨在解决企业AI落地中的‘黑盒成本’问题,让CTO能像管云服务器一样管AI模型使用

号哥说:Harness填补了企业AI治理的关键空白:当多个团队共用一套模型API时,谁在用、怎么用、花了多少,必须可追溯。它不炫技,但直击财务与合规刚需,是AI从‘技术实验’走向‘业务基础设施’的必要组件。

落地提点:只要公司超过50人用AI,就该装Harness——不然月底账单来了,你都不知道钱花哪了。

Hacker News · 阅读原文


行业 AI 落地

1. Unitree G1四足机器人成中国新晋网红,正试点物流搬运与巡检

中国公司Unitree推出的G1四足机器人,凭借相对亲民价格(约1.2万美元)和灵活运动能力,在海外社交平台走红,获超200万粉丝

目前已在长三角三家电子厂开展试点:承担仓库货架间物料搬运、产线设备温度与震动巡检、以及夜间安防巡逻

试点数据显示:单台G1日均完成搬运任务137次,异常检测准确率达92.4%,人力替代率达68%(按工时计)

号哥说:这不是实验室玩具,而是已进入真实产线的工业Agent。G1的成功在于‘够用就好’:不追求人形拟真,专注解决制造业最痛的‘最后一公里搬运’和‘重复性巡检’。对中小制造企业,它提供了比AGV更灵活、比人工更不知疲倦的自动化选项。

落地提点:制造业老板别只盯机械臂,四足机器人正悄悄接下那些‘人不想干、车开不到’的活。

Wired AI · 阅读原文


2. PBS电视台遭遇云服务商‘失联’危机,恐丢失50TB历史影像资料

美国PBS某地方台因合作云存储服务商突然停止服务且拒绝提供数据导出接口,面临50TB珍贵历史节目影像永久丢失风险

该事件暴露媒体行业AI转型中的致命短板:大量AI生成字幕、标签、摘要依赖云端服务,一旦断供,原始资产即成‘数字废墟’

业内呼吁建立‘AI增强型归档标准’,要求所有AI处理结果必须与原始素材绑定存储,并支持离线验证

号哥说:这是一记警钟:AI不是万能胶,反而可能放大数据主权风险。对广电、出版、档案机构,真正的AI落地不是‘用AI处理内容’,而是‘用AI加固内容主权’——比如用本地化模型生成元数据,确保即使云服务消失,内容依然可检索、可理解。

落地提点:做媒体、出版、档案的,AI第一步不是加智能,而是把AI生成的所有标签、摘要、转录,跟原始文件一起打包存本地。

Ars Technica · 阅读原文


3. 麦当劳向用户交付515页个人数据报告,揭示AI驱动的会员画像深度

一名用户依GDPR请求获取麦当劳忠诚计划数据,收到长达515页的PDF报告,包含其3年内的每一笔消费、停留时长、APP点击路径、甚至预测流失概率与个性化优惠券历史

报告证实麦当劳已将AI深度嵌入运营:用行为序列建模预测顾客偏好,动态调整门店库存与促销节奏

该案例显示:零售业AI落地早已越过‘聊天客服’阶段,进入‘全链路行为驱动决策’时代

号哥说:这份515页报告是零售AI的‘实体证据’——它证明AI不是后台黑盒,而是直接塑造消费者每一次打开APP、走进门店的体验。对其他零售品牌,关键启示是:数据采集的颗粒度,决定了AI提效的上限。

落地提点:零售老板别只关心AI能不能回消息,先问问你家APP能不能像麦当劳一样,把用户每次滑动都变成可行动的数据。

Hacker News · 阅读原文


4. 加州批准自动驾驶卡车在高速公路上测试,Aurora与Kodiak获首批许可

加州DMV向Aurora Innovation和Kodiak AI颁发首批自动驾驶货运卡车道路测试许可,允许其在I-5、I-10等主干道进行无安全员测试

两家公司均采用‘AI驾驶员+远程监督中心’模式,车辆配备多模态传感器与V2X通信模块,可实时响应交通管制与天气变化

此举标志着AI Agent从‘办公室流程’正式切入‘物理世界高危作业’,对物流、采矿、农业等行业具强示范效应

号哥说:自动驾驶卡车获批,表面是交通政策松动,实质是AI Agent在物理世界可信度的重大跃升。它验证了‘感知-决策-执行’闭环能在真实复杂环境中稳定运行,这对所有需要AI接管物理操作的行业(如港口装卸、矿区运输)都是关键信心信号。

落地提点:物流、矿山、农场老板注意:AI司机不是未来概念,是加州已发驾照的现实——下一步就是招‘远程监督员’了。

TechCrunch Transportation · 阅读原文


5. Google用同态加密实现私有AI推理,医疗与金融场景迎来新可能

Google宣布在其AI服务中集成同态加密(一种允许在加密数据上直接计算的技术),使客户能在不暴露原始数据前提下完成模型推理

该技术已在部分医疗影像分析POC中验证:医院上传加密CT片,Google模型返回加密诊断建议,医院本地解密后使用

对金融风控、基因分析等强隐私场景,这意味着AI模型可部署在客户侧,彻底规避数据出境与泄露风险

号哥说:同态加密长期被视为‘学术玩具’,Google这次将其带入真实业务场景,解决了AI落地最大的信任障碍之一。它不改变模型能力,但改变了数据主权格局——对受监管行业,这才是比模型精度更重要的突破。

落地提点:医疗、金融、政务系统做AI,别再纠结‘数据能不能上云’,赶紧研究同态加密怎么接入你的现有系统。

Hacker News · 阅读原文

———— 关于我们 ————

「号哥聊AI」专注 AI 落地:帮企业把重复、跨系统的流程做成 AI Agent(采购、客服、单据、报表……)。

· 想让公司某个流程自动化 —— 在本号【发消息回复「自动化」】,我们帮你看看能怎么落地;

· 想学 Agent 开发 / AI 工具 —— 关注本号,每天更新。

本文为 国外最新的AI资讯摘要与点评,非原文转载;版权归原作者所有,点击链接可读原文。


📚 往期回顾

Similar Posts