Echo 用多模型路由实现 Fable 级效果、推理成本仅三分之一
大模型 API 的成本一直是智能体应用落地的主要门槛之一。Tracer 推出的 Echo 提出了另一种思路:不依赖单一最强模型,而是用一个调度系统在多个开源模型之间动态分配计算。
Echo 在收到每个请求后,会决定投入多少计算量、调用哪些模型、以及如何组合它们的输出。一些简单任务可能只需轻量推理,而复杂问题则会触发多个模型协同工作。在首批评估中,Echo 在 MATH-500、Belebele、MMLU-Pro 等多个基准上达到了接近 Claude Fable 的结果,而相比之下,其推理总成本仅为 Fable 的大约三分之一。
这一成绩的背后是一个有意思的发现:模型之间具有很强的互补性。整体上较弱的模型在特定问题上可能比强模型表现更好。Echo 试图在实际系统中捕捉这种优势——在不知道未来答案的情况下,实时判断哪些模型值得被调用、各自承担什么角色。
目前 Echo 已提供聊天界面和 OpenAI 兼容 API,支持外部测试。项目由 Y Combinator 支持的 Tracer 实验室开发,评估方法和模型路线图均公开可查。
对于构建智能体应用和模型路由基础设施的团队来说,Echo 展示了一个值得关注的趋势:推理层的智能调度可能比堆叠更大模型更具成本效益。