Pavo:推荐流和搜索排序的调优,先读懂系统再派一队智能体动手

让生产系统自己变好,前提是它先被真正读懂。

推荐流、搜索排序、通知推送这类系统,一旦上线就进入一种尴尬状态:所有人都知道它重要,却很少有人说得清它究竟怎么跑。改一个指标要排期几个月,改完还得靠线上流量验证。Pavo 要做的,是把「读懂系统、找出改动、证明有效」这套动作变成一条可反复运转的流水线。

它不是给终端用户用的助手,而是装在工程与产品团队背后的平台:跑在客户自己的云账号里,用只读方式接入代码仓库、数据仓库、看板和实验平台,默认不外传数据,目标则是让某一个指标真的动起来。

改不动的往往不是模型,而是没人说得清系统怎么跑

一个推荐流上线三年,代码翻了几轮,看板换过两次,当初为什么把某个特征的权重调高,答案散在几位老同事的记忆里。新人接手,或者让一个智能体接手,第一道坎从来不是怎么写代码,而是这个系统到底怎么跑的。更麻烦的是改指标天然昂贵,猜错一次就是线上事故,团队于是只做有把握的小改动,真正能推动指标的大改动反而一直躺在待办列表底部。

第一步,把散落的经验读成一本带出处的书

Pavo 的第一个模块叫 System Knowledge。它把已接入来源里的信息抽成一条条事实,每条都带类型和出处:这句话来自哪个文件的哪一行、哪条查询、哪次实验。抽完还不算完,它会把事实蒸馏成一本可逐章评审的手册,也就是 System Book。

Pavo indexed knowledge view showing warehouse tables and code files turned into cited knowledge entries
知识索引把仓库表、代码文件等来源整理成带出处的条目,每层索引都建立在前一层之上

这套手册不靠模型自说自话。Pavo 配了一套叫 Knowledge Bench 的检验机制,由团队自己出题给它打分,分数不够就说明知识还没被真正理解,而不是看起来差不多。官方把这条原则写成一句话:知识是被验证的,不是被假设的。

第二步,把问题交给一队各管一小块的智能体

第二个模块叫 Agent Studio,负责把前面攒下的理解花出去。你交给它一个真问题,它会先把问题拆成计划:科学框架、模块划分、证据规则,全部摆在台面上等你确认。你不点头,它不动手。

Agent Studio program home showing the approved plan, the program result, and five modules with task progress
一个跑完的改进项目:批准过的计划、最终结果与五个模块的进度都留在同一页

确认之后,工作会分给一队智能体。每个智能体只负责一小块可检查的任务,上面还有一个负责协调的 Director,负责分配任务、盯着其他智能体的进展、把各自的发现对齐,出问题时自己介入。

Task Studios list where every scoped agent has its own studio mapped to a module and an active plan
每个任务有自己的工作室,各对应一个模块与一份当前计划,谁在跑谁在等一目了然

这套结构的价值在于可查。每个结果都是带类型、带引用、带版本的答案,明确写清它证明了什么,也写清它没有证明什么。官方对此的解释很直接:把为期数周的研究问题丢给单个智能体,它会跑几个小时、做一百个你没看见的小决定,最后自信地交回一个错误答案;解法不是换个更聪明的智能体,而是给它结构。

让它在该拍板的地方停下来

Pavo 把决策点和进度更新分开:只在需要拍板的边界上停下,并告诉你变了什么、为什么要你来定、不同选择会打开哪条路径。其余时间,这队智能体自己跑。

Decision boundaries page listing checkpoints where human judgment is required and the ones already accepted
决策边界页只列出需要人拍板的节点,其他时间这队智能体自主推进

一轮改进是怎么跑完的

把两步接起来就是一整个循环:连接技术栈,建立系统知识,在 Agent Studio 里跑一个项目,交付能推动指标的改动。发现写回手册,成为下一轮起点。

在面向企业的形态里,这个循环被压进八周:第一周定指标与成功标准,第二周接通系统,第三到四周并行评估多个候选方案并先在离线环境选出胜者,第五到六周把胜者作为线上实验放出,第七到八周测出提升、转向下一个问题。官方提到,理解加深后,同一团队回答更难的科研问题所需时间会从几周缩短到几天。

它把什么留在你自己的环境里

这类平台能不能进企业,往往卡在数据这一关。Pavo 提供三种部署形态:托管在它自己的云上,多租户但按组织隔离;部署到客户自己的云账号里,单租户、用客户的密钥加密、默认不出网;以及受监管行业用的加固版本,所有服务在客户网络内自托管,不部署第三方集成。

三条原则贯穿所有形态:接入只读,连接器只从你的来源拉取,绝不回写你的系统;客户数据不用于训练模型;外部大模型在零留存条款下运行。平台已通过 SOC 2 Type II 与 ISO/IEC 27001 认证,另有每年一次的独立渗透测试。

用之前需要知道的事

价格不公开。费用由两部分构成:按系统规模确定的平台费,以及按用量计费的科研工作量,计量单位叫 ASU,定义是「一个应用科学智能体工作一个坐次」。官方明确写了不按席位收费,接入多少数据源也不另行计费,平台费按年度合约走,同时给了九十天退出窗口。

它没有面向个人的版本,从接触到跑通要走一遍商务流程。想自己跑循环的团队走自助模式;想让指标先被证明一次再投入的,可以选科学家驻场,由一名应用科学家嵌入团队、围绕单一指标在约八周内跑完一轮,再把循环交还团队。如果你的智能体系统已经在输出调用链记录,接入不必迁移技术栈,可以直接从已有历史数据开始;反过来,它需要真实的生产数据和足够的系统上下文,否则发挥不出全部价值。

它要解决的从来不是让 AI 替你写代码,而是让一个没人说得清的生产系统,变成一份可以被评审、被验证、被反复改进的公开知识。

Pavo下载地址
支持的操作系统: Web