Skip to main content
Version: v2.0

aixplain.v2.eval_results_display

Display helpers for AgentEvaluationRun results.

Load CSV exports (from to_dataframe), pivot long rows into side-by-side wide tables, summarize metrics by agent, and build simple HTML for notebook widgets.

guess_compare_value_columns

def guess_compare_value_columns(df: pd.DataFrame) -> List[str]

[view_source]

Columns to compare by default: output plus flattened metric payload columns.

load_eval_csv

def load_eval_csv(path: Union[str, Path],
**read_csv_kwargs: Any) -> pd.DataFrame

[view_source]

Load a CSV written from evaluator results (e.g. df.to_csv(...)).

For a structured AgentEvaluationRun, use load_from_csv instead.

Arguments:

  • path - Path to the CSV file.
  • **read_csv_kwargs - Forwarded to pandas.read_csv.

Returns:

DataFrame in the same long shape as AgentEvaluationRun.to_dataframe.

pivot_agents_wide

def pivot_agents_wide(df: pd.DataFrame,
value_columns: Optional[Sequence[str]] = None,
*,
include_query: bool = True,
include_reference: bool = True) -> pd.DataFrame

[view_source]

Pivot long evaluator output so each case is one row and agents appear as columns.

Column index is a MultiIndex. Pivoted fields use (value_field, agent_name). query and reference use (field_name, "") so they share two levels and concatenate cleanly with pivoted columns.

Arguments:

  • df - Long-format evaluation results.
  • value_columns - Columns to pivot; defaults to guess_compare_value_columns.
  • include_query - If True and query is present, join one query per case_index.
  • include_reference - Same for reference.

Returns:

Wide DataFrame indexed by case_index.

Raises:

  • ValidationError - If required columns are missing or pivot inputs are invalid.

summarize_by_agent

def summarize_by_agent(df: pd.DataFrame) -> pd.DataFrame

[view_source]

Per-agent row counts, failure counts, and means of numeric metric columns.

Non-numeric metric columns (e.g. string scores) are omitted from means. Columns ending with __metric_pass add pass_rate__, n_passed__, and n_evaluated__ fields (threshold pass/fail) per agent. agent_run_failed is coerced from strings when loaded from CSV.

Arguments:

  • df - Long-format evaluation results.

Returns:

One row per agent_name.

Raises:

  • ValidationError - If agent_name is missing.

case_rows

def case_rows(df: pd.DataFrame, case_index: int) -> pd.DataFrame

[view_source]

Return long-format rows for a single case_index.

case_comparison_html

def case_comparison_html(df: pd.DataFrame,
case_index: int,
*,
max_output_chars: Optional[int] = 8000) -> str

[view_source]

Build a simple HTML table comparing agents for one case (for notebooks).