agenteval

package
v0.5.11 Latest Latest
Warning

This package is not in the latest version of its module.

Go to latest
Published: Aug 12, 2026 License: Apache-2.0 Imports: 5 Imported by: 0

Documentation

Overview

Package agenteval 提供 Agent 的质量评估基线(非性能基准)。

它把任意 Agent 适配为评估框架的被测系统,在参考数据集上用一组评估器(含 LLM-as-judge)打分,并按最低分阈值判定每个质量维度是否达标——为 Agent 建立可 重复运行、可回归的质量闭环(区别于 bench/ 的性能基准)。

Index

Constants

This section is empty.

Variables

This section is empty.

Functions

This section is empty.

Types

type AgentSystem

type AgentSystem struct {
	// contains filtered or unexported fields
}

AgentSystem 把 Runnable 适配为 evaluate.SystemUnderTest。

func NewAgentSystem

func NewAgentSystem(a Runnable) *AgentSystem

NewAgentSystem 创建 Agent 被测系统适配器。

func (*AgentSystem) Run

Run 执行查询并把 Agent 输出转为评估框架的系统响应。

type BaselineResult

type BaselineResult struct {
	// Report 完整评估报告
	Report *evaluate.EvalReport
	// Passed 是否所有质量维度均达到基线
	Passed bool
	// Failures 未达标维度的说明(指标名 + 实际均分 + 基线阈值)
	Failures []string
}

BaselineResult 是 Agent 质量基线评测结果。

func QualityBaseline

func QualityBaseline(
	ctx context.Context,
	a Runnable,
	dataset *evaluate.Dataset,
	minScore float64,
	evaluators ...evaluate.Evaluator,
) (*BaselineResult, error)

QualityBaseline 用一组评估器在参考数据集上评测 Agent,并按 minScore 判定每个指标是否达标。

任一指标平均分低于 minScore 即基线不通过(Failures 列出未达标项)。这是 Agent 的质量基线:把它纳入 CI/回归即可在 Agent 行为退化时被挡下,而非只看性能。

type Runnable

type Runnable interface {
	Run(ctx context.Context, input agent.Input) (agent.Output, error)
}

Runnable 是质量评估只需的最小 Agent 能力:执行一次查询。

agent.Agent 天然满足该接口;按需窄化依赖(只要 Run),便于评测任意可执行体。

Jump to

Keyboard shortcuts

? : This menu
/ : Search site
f or F : Jump to
y or Y : Canonical URL