Decathlon用Chronos-2实现周级需求预测,准确率提升15点仅耗0…|AI落地与Agent
有人把整套报关流程交给了 Agent,人只签字;而体育巨头 Decathlon 把上万SKU的订货决策,交给了一个开源时序模型——它跑在普通CPU上,每周只要3美分。
▍今日主打
Decathlon用Chronos-2实现周级需求预测,准确率提升15点仅耗0.03美元

Decathlon 全球数十万SKU、横跨多洲的周级需求预测,过去依赖复杂规则+人工校准,响应慢、误差大。这次他们将 Chronos-2(亚马逊开源的轻量级时序大模型)部署在 AWS 上,不调用GPU,纯CPU推理,单次周预测成本压至约0.03美元,同时将平均预测准确率提升11–15个百分点——这不是实验室指标,而是真实采购订单达成率的跃升。
对想落地AI自动化的企业而言,这是一份可抄的「降本增效」作业:它证明了不必堆算力、不需定制大模型,用现成开源时序Agent(Chronos-2支持工具调用与多步推理)+ 企业已有销售/库存数据,就能重构供应链核心环节。对开发者来说,这是极佳的Agent工程样板——Chronos-2被封装为可调度服务,接入ERP数据管道后自动触发预测、生成补货建议、甚至调用邮件API通知采购员,全程无硬编码。
适合快消、零售、制造业中已有稳定结构化销售时序数据的团队。别急着上LLM,先把你最痛的那个预测场景(如门店补货、安全库存设定)切出来,用Chronos-2跑通端到端闭环——它比你想象中更轻、更快、更便宜。
—— 以下是今天的全部 15 条速览 ——
Agent 与流程自动化
1. Decathlon用Chronos-2实现周级需求预测,准确率提升15点仅耗0.03美元

Decathlon 部署开源时序大模型 Chronos-2,在AWS CPU实例上运行周级需求预测,覆盖数万个产品和多个大洲市场;
预测准确率提升11–15个百分点(具体指标未公开,但明确指向采购订单满足率等业务指标);
单次全量周预测成本约0.03美元,显著低于传统方案,且大幅降低运维复杂度。
号哥说:这不是炫技,是真正在生产环境扛住业务压力的Agent落地:用轻量模型解决重流程问题,效果可量化、成本可计算、路径可复制——零售/制造企业供应链负责人该立刻拉出自己最常救火的SKU清单试一试。
落地提点:小团队别碰LLM做预测,先用Chronos-2跑通一个SKU的周补货闭环,数据对得上、结果能进ERP,再扩量。
AWS Machine Learning Blog · 阅读原文
2. Terminal-Bench-Science发布首个面向科研工作流的AI Agent评测基准

Terminal-Bench-Science 是专为评估AI Agent在真实科研任务中表现设计的新基准;
覆盖文献综述、实验设计、代码复现、论文撰写等完整科研链路,强调工具调用、多步推理与容错能力;
已开源,支持本地部署与自定义任务扩展,目标是替代纯语言理解类benchmark。
号哥说:当前Agent评测严重脱钩实际场景——这个新基准把‘读论文→写代码→跑实验→改图表→润色投稿’整个链条变成可打分的测试项,开发者终于能验证自己的Agent是否真能在实验室里干活,而非只在玩具任务上刷高分。
落地提点:做科研Agent的团队,别再只跑AlpacaEval了,用Terminal-Bench-Science测一次真实工作流,结果比任何参数量都说明问题。
Hacker News · 阅读原文
3. OpenAI正开发‘Persistent Mode’:Codex Agent可长期驻留并自主生成后续任务
OpenAI内部代码显示,其AI Agent Codex正在构建‘Persistent Mode’(持久模式),支持长期驻留、状态保持与自主任务规划;
Agent不再仅响应用户指令,而是基于上下文主动识别下一步动作,例如发现报告异常后自动查日志、调API、发告警;
该能力已在部分内测版本中出现,尚未向公众开放,但代表Agent从‘工具调用’迈向‘目标驱动’的关键演进。
号哥说:这标志着Agent范式升级:从‘你让我干啥我干啥’变成‘我知道该干啥并持续干下去’。对想建自动化流程的企业,意味着未来可部署一个Agent盯住某条产线/某类客诉/某项KPI,它自己判断、执行、反馈,人只需设目标和审核结果。
落地提点:别急着学怎么写Prompt,先理清你最想甩给Agent盯的那件事——它有没有明确起始、中间步骤和成功终点?这才是Persistent Mode能接住的活。
The Decoder · 阅读原文
4. GLM-5.3开源:Z.ai发布新一代开放权重中文大模型,支持长上下文与高效推理
Z.ai正式开源GLM-5.3,支持256K上下文长度,针对中文语义理解与工具调用优化;
模型采用混合专家(MoE)架构(一种让大模型只调用部分参数、从而更省算力的设计),推理速度比同尺寸稠密模型快40%;
已在Hugging Face开放下载,并提供配套微调脚本与推理示例,重点适配Agent场景。
号哥说:对国内企业做Agent开发意义重大:无需依赖闭源API,即可获得高性能、长上下文、低延迟的中文底座;尤其适合需要处理合同/报表/工单等长文本的自动化流程,且MoE架构天然适配边缘或私有云部署。
落地提点:做客服/法务/财务Agent的团队,直接拉GLM-5.3跑通一个工单分类+摘要+回复生成链路,比调GPT API更可控、更省钱、更合规。
Hacker News · 阅读原文
5. Salesforce用SageMaker Inference Components实现多可用区高可用AI服务

Salesforce为满足金融级合规要求,将AI模型副本通过SageMaker Inference Components的SchedulingConfig参数,跨多个AWS可用区(AZ)部署;
在保障Multi-AZ高可用前提下,仍复用多模型共宿(multi-model hosting)能力,避免资源闲置;
该方案使模型服务SLA达99.99%,同时未牺牲成本效率,已用于其客户服务Agent核心推理层。
号哥说:这是企业级Agent落地的关键基建实践:不是‘能不能跑起来’,而是‘能不能7×24小时扛住千万级并发且不出事’。Salesforce用标准云服务配置就解决了高可用难题,给所有要上生产Agent的公司提供了可复用的部署范式。
落地提点:你的Agent还没上生产?先照着Salesforce这篇配置SageMaker多AZ部署,哪怕只跑一个demo模型——稳定性比功能更重要。
AWS Machine Learning Blog · 阅读原文
AI 工具 · 实测上新
1. Vercel开源vgpu:TypeScript原生WebGPU库,让AI Agent可在浏览器运行shader推理

Vercel开源vgpu,一个TypeScript编写的WebGPU库,将.wgsl着色器文件作为可导入模块;
支持同一段shader代码在浏览器、Node.js(Dawn)、CI环境三端一致运行,输出确定性结果;
已用于vercel.com前端特效,压缩后仅25KB,为轻量AI Agent在客户端执行图形/信号处理任务提供新可能。
号哥说:这是少有的真正打通‘前端智能’的工具:以往Agent逻辑全在服务端,而vgpu让图像预处理、实时滤镜、传感器数据流分析等任务可下沉到浏览器端执行,既保护隐私又降低延迟——适合做智能表单、AR导购、实时质检等交互密集型Agent。
落地提点:做B端SaaS的开发者,别只盯着LangChain,试试用vgpu在前端跑个OCR预处理或图像质量初筛,用户上传瞬间就反馈,体验碾压服务端排队。
MarkTechPost · 阅读原文
2. AI Engineer Notebooks:免费、无框架的Colab RAG/Agent/Eval实战模板集
GitHub项目ai-engineer-notebooks提供一系列免安装、免配置的Google Colab笔记本;
涵盖RAG构建、Agent编排、评估指标计算等全流程,全部使用原生Python+Hugging Face生态,不依赖LangChain/LlamaIndex等框架;
每个Notebook均含真实数据样例与可一键运行的代码,适合零基础快速上手Agent开发。
号哥说:对想学Agent开发的新手极其友好:绕过庞杂框架,直击核心逻辑——如何切chunk、如何选embedding、如何设计tool call、如何用LLM做pairwise eval。它不是教你怎么用工具,而是教你为什么这么用。
落地提点:刚学Agent?别装10个库,直接打开这个Colab,跑通一个PDF问答RAG,再加个天气查询tool,你就懂Agent骨架了。
Hacker News · 阅读原文
3. Experiential Labs开源OpenRouter:Rust编写的模型网关,统一管理自托管与第三方大模型
OpenRouter是一个开源模型网关,支持本地自托管模型、前沿闭源模型(如Claude、Gemini)及开源模型(Llama、Qwen)统一接入;
用Rust编写,原生支持高并发,自动处理各模型API差异(流式格式、tool call规范、限速策略、错误码);
BYOK(自带密钥)请求平均延迟增加不足1ms,可作为企业Agent系统的‘模型路由中枢’。
号哥说:企业做Agent平台最头疼的不是模型能力,而是对接N家API的兼容性噩梦。OpenRouter把这件事标准化了——它不训练模型,但让所有模型在你系统里‘说同一种话’,极大降低Agent工程维护成本。
落地提点:正在搭Agent平台的工程师,用OpenRouter替代手写N个Adapter,一周省下三天联调时间,还避免未来API变更翻车。
Hacker News · 阅读原文
4. Gemini 3.5 Transcribe发布:双模式语音转文字,流式延迟<1秒、批量WER仅2.6%

Google发布Gemini 3.5 Transcribe,提供流式与批量两个独立API端点;
流式端点延迟<1秒,但不支持说话人分离与词级时间戳;批量端点保留全部功能,成本为流式的两倍;
在85+语言上平均词错误率(WER)达2.6%,较前代Chirp 3提升70%最终化速度。
号哥说:语音是企业Agent最常用入口之一,但现有ASR要么贵、要么不准、要么缺功能。Gemini 3.5 Transcribe首次把‘快’和‘全’拆成两个选项,让开发者按场景选:客服对话用流式保实时,会议纪要用批量保质量——这才是工业级语音Agent该有的弹性。
落地提点:做语音Agent的团队,别再用一个ASR硬扛所有场景,按‘实时交互’和‘事后分析’拆开调用Gemini Transcribe双端点,体验和成本双赢。
MarkTechPost · 阅读原文
5. Amazon SageMaker Feature Store新增BatchWriteRecord和ListRecords API

SageMaker Feature Store新增两个API:BatchWriteRecord支持单次写入最多25条记录到多个特征组;
ListRecords支持按特征组枚举所有记录ID,便于构建特征血缘与监控;
两项更新显著简化了特征工程流水线,尤其利于Agent需动态加载/发现特征的场景(如个性化推荐、风控决策)。
号哥说:Feature Store常被当成‘数据仓库’,但它其实是Agent的‘记忆中枢’。这两个API让Agent能更轻量地读写特征、追溯来源,把‘记住用户上次投诉类型’这类能力真正工程化,而不是靠临时缓存或硬编码规则。
落地提点:你的Agent还在用Redis存用户偏好?赶紧迁到Feature Store,用ListRecords做特征探查,用BatchWriteRecord做实时偏好更新,这才是可持续的智能。
AWS Machine Learning Blog · 阅读原文
行业 AI 落地
1. 泰国启动AI健康教育初创加速器,OpenAI与MHESI联合孵化10支团队
OpenAI与泰国高等教育与科研部(MHESI)合作推出八周加速器,聚焦健康、 wellness 和教育领域;
入选的10支本土初创团队将获技术指导、API额度与产品合规支持,目标是将AI原型转化为可信赖的落地产品;
项目强调本地化数据治理与临床验证路径,非简单移植西方模型。
号哥说:这是东南亚首个由顶级AI公司深度参与的垂直行业加速器,释放明确信号:AI医疗教育不是概念,而是正在被政策、资金与本地化能力共同托举的产业。中国同类创业者可参考其‘小场景切入+监管协同+临床闭环’路径。
落地提点:做AI+医疗/教育的国内团队,别只盯着FDA或NMPA,研究泰国这套‘政府出场景、OpenAI出模型、本地机构验效果’的三角模式,更易落地。
OpenAI News · 阅读原文
2. Beatport封禁纯AI生成音乐上架,成为首个实施AI内容识别与拦截的DJ平台

电子音乐平台Beatport宣布即日起禁止完全或主要由AI生成的音乐上架其DJ市场;
平台已部署AI检测工具,对提交作品进行声纹与创作模式分析,误判可申诉;
此举意在保护人类创作者权益,同时建立AI内容标注与分级标准。
号哥说:这是内容平台对AI生成物的首次系统性治理实践,不一刀切封杀,而是用技术识别+人工复核+分级标注构建新规则。对营销、设计、音视频等行业做AI自动化,它提供了关键参考:合规不是不做,而是‘可识别、可追溯、可解释’。
落地提点:做AI内容生成的团队,别等平台封你,现在就给每条输出加不可删除的‘AI生成’水印+元数据,这是未来所有B端交付的标配。
The Decoder · 阅读原文
3. Meta测试数据中心机器人:可换线缆、重启服务器,替代部分人工巡检

Meta正于自有数据中心测试自主机器人,执行电缆插拔、服务器重启、硬件状态检查等物理操作;
机器人集成视觉识别与机械臂控制,任务成功率超92%,已进入小规模值班轮岗阶段;
目标是将重复性物理运维工作自动化,释放工程师专注故障诊断与架构优化。
号哥说:这是AI Agent从‘数字世界’迈向‘物理世界’的关键一步:不是模拟,而是真刀真枪干体力活。对制造业、能源、物流等重资产行业,它验证了‘AI+机器人’在设备运维场景的ROI可行性。
落地提点:你的工厂有上百台PLC或服务器?别急着买机械臂,先用Meta这套思路,给现有设备加IoT传感器+远程控制接口,让Agent先‘动嘴’指挥人,再逐步替‘动手’。
Wired AI · 阅读原文
4. 医生开始系统学习抗抑郁药撤药管理,AI辅助工具进入临床指南讨论

《新科学家》报道,全球多国医生正接受规范化培训,应对抗抑郁药撤药综合征这一长期被忽视的问题;
多家医学AI公司已开发用药风险评估模型与患者教育聊天机器人,部分进入NICE(英国国家卫生研究院)初步评估;
AI工具聚焦剂量调整建议、症状追踪与个性化减停路径生成,非替代医生,而是强化循证决策。
号哥说:这是AI在严肃医疗场景落地的典型路径:不挑战诊断权威,而是补足临床知识断层与患者管理盲区。对医疗信息化厂商,它指明了方向——AI价值不在‘比医生强’,而在‘让医生更稳’。
落地提点:做医疗AI的团队,放弃‘替代医生’的幻想,专注把一个临床痛点(比如这个撤药管理)做成医生愿意每天点开的工具,比做个通用大模型更值钱。
Hacker News · 阅读原文
5. 中国车企集体押注人形机器人:从造车延伸至‘下一个利润机器’

比亚迪、小米、蔚来等多家中国车企宣布布局人形机器人研发与量产,目标2027年进入家庭与工厂场景;
技术路径高度复用智能汽车的感知、决策、执行栈,如激光雷达方案、BEV+Transformer架构、电机控制经验;
首波产品聚焦仓储搬运、产线巡检、家庭陪护等B端与高端C端场景。
号哥说:这不是跨界玩票,而是基于‘汽车即移动机器人’的技术迁移——车企把十年积累的实时感知、运动控制、安全冗余能力,平移至人形机器人,极大缩短商业化周期。对制造业客户,这意味着国产机器人交付周期与服务响应将远优于海外竞品。
落地提点:你的工厂在招AGV或机械臂供应商?优先约见这些车企机器人团队,他们带的是车规级可靠性+消费级成本意识,不是实验室Demo。
TechCrunch Robotics · 阅读原文
———— 关于我们 ————
「号哥聊AI」专注 AI 落地:帮企业把重复、跨系统的流程做成 AI Agent(采购、客服、单据、报表……)。
· 想让公司某个流程自动化 —— 在本号【发消息回复「自动化」】,我们帮你看看能怎么落地;
· 想学 Agent 开发 / AI 工具 —— 关注本号,每天更新。
本文为 国外最新的AI资讯摘要与点评,非原文转载;版权归原作者所有,点击链接可读原文。
📚 往期回顾
- Amazon Quick + fal 构建可复用创意 Agent 工作流|AI落地与Agent
- Natera用Bedrock AgentCore实现100%准确语音预约|AI落地与Agent
- AWS OpenSearch MCP Apps实现Agent可观测性闭环|AI落地与Agent
- Amazon Connect Agentic Voice 实现餐厅电话点餐全自动|AI落地与Agent
- Vercel推Is Agentic:免费网站Agent就绪度评分工具|AI落地与Agent
- Munder Difflin:用AI Agent组建虚拟办公室,克隆你来处理采…|AI落地与Agent
- AWS推ADOP:用AI Agent把数据工程从周压缩到小时|AI落地与Agent