南京,中国
项目2026年5月6日

通用 AI 评测和计量引擎

不同模型和 Agent 任务的执行协议、运行环境与指标格式并不一致。这个项目通过配置驱动的方式统一管理数据、模型、Agent、环境、指标和评测任务,让预测评测、代码修复 Agent 与多轮对话 Agent 能进入同一套执行流程。 我参与 Agent 评测主流程和外部评测任务接入,负责统一 ReAct、Function Calling、环境租约、验证执行、产物落盘与结果评估,并完成不同执行模式和外部评测框架之间的协议适配。
  • 评测主流程:串联 Agent 推理、工具调用、环境租约、验证执行、产物落盘和结果评估,形成端到端评测闭环。
  • 双模式调度:根据任务选择内置 Harness 或外部 Agent 执行,并统一执行协议与结果格式。
  • External Harness:将 Harbor 等外部评测框架的配置转换、Job 启动、进度观测和结果整理接入平台。
  • 任务适配:为 ForecastBench、Tau2 等任务补充配置适配,覆盖预测评测、代码修复 Agent、多轮对话 Agent 和指标统计。
  • 统一 ReAct 与 Function Calling 的执行链路,使不同 Agent 交互方式共享环境、验证和结果处理能力。
  • 将环境租约纳入任务生命周期,集中处理评测环境的获取、使用与释放。
  • 设计内置 Harness 与外部 Agent 双模式调度,减少不同执行方接入时对主流程的侵入。
  • 通过 External Harness 对接 Harbor,统一外部任务的配置转换、启动、进度观测与结果整理。
  • 完成 ForecastBench、Tau2 等任务适配,使不同任务类型以一致的配置和结果格式进入平台。
Python、ReAct、Function Calling、External Harness、Harbor、ForecastBench、Tau2

相关项目

金融助手长期记忆服务

面向投顾类 AI Agent 的长期记忆服务,支持结构化写入、跨轮召回、状态过滤、审计回放与删除治理。

Ksmart

企业级 RAG 智能知识库平台,覆盖多格式文档解析、异步入库、混合检索、权限控制和 AI 流式问答。

MYDB

从零实现的轻量级关系型数据库,覆盖页式存储、缓存管理、B+ 树索引、WAL、事务隔离、SQL 解析和 C/S 通信。