动察 Beating AI 快讯,AI Agent 可观测性平台 Laminar 发布专门检查 Agent 执行轨迹的模型 flow-1。它会读取模型调用、工具调用和返回结果,找出 Agent 在哪一步出错、为什么出错。
flow-1 运行在 Laminar 的 Signals agent 中。模型可以搜索整条 trace(Agent 的完整执行记录),再按需查看具体步骤。训练时,Laminar 先用合成调查数据做监督微调,再通过强化学习训练工具调用和复杂 trace 分析。
在 Laminar 自建的 523 条困难 trace 测试中,flow-1 的错误检测 F1 为 0.835,GPT-6-sol 为 0.816。sol 召回率更高,能找到更多真实错误;flow-1 精确率更高,误报更少。
对于不足 10 万 LLM tokens 的 trace,flow-1 平均每条分析约 0.0011 美元,GPT-6-sol 约 0.026 美元。按 Laminar 测算,1 美元分别能分析约 888 条和 38 条 trace,相差约 23 倍。flow-1 的成本也比 GPT-6-luna 低约 25%。
目前这些成绩都来自 Laminar 自建 benchmark,暂无第三方复测。flow-1 的训练数据主要来自合成工作流,其中约 48% 是软件工程任务。社区已经有人质疑,它面对真实生产环境里没有预先设计过的新型故障时能否保持同样表现。
----------缘辉旺盾网量化工具温馨提示:数字货币投资有风险,入市需谨慎;本文章不作为投资依据,仅供参考 ----------交流群:https://t.me/dunwangyuanhuiwang