aixplain.v2.eval_results_display
Display helpers for AgentEvaluationRun results.
Load CSV exports (from to_dataframe),
pivot long rows into side-by-side wide tables, summarize metrics by agent, and build
simple HTML for notebook widgets.
guess_compare_value_columns
def guess_compare_value_columns(df: pd.DataFrame) -> List[str]
Columns to compare by default: output plus flattened metric payload columns.
load_eval_csv
def load_eval_csv(path: Union[str, Path],
**read_csv_kwargs: Any) -> pd.DataFrame
Load a CSV written from evaluator results (e.g. df.to_csv(...)).
For a structured AgentEvaluationRun, use
load_from_csv instead.
Arguments:
path- Path to the CSV file.**read_csv_kwargs- Forwarded topandas.read_csv.
Returns:
DataFrame in the same long shape as AgentEvaluationRun.to_dataframe.
pivot_agents_wide
def pivot_agents_wide(df: pd.DataFrame,
value_columns: Optional[Sequence[str]] = None,
*,
include_query: bool = True,
include_reference: bool = True) -> pd.DataFrame
Pivot long evaluator output so each case is one row and agents appear as columns.
Column index is a MultiIndex. Pivoted fields use (value_field, agent_name).
query and reference use (field_name, "") so they share two levels
and concatenate cleanly with pivoted columns.
Arguments:
df- Long-format evaluation results.value_columns- Columns to pivot; defaults toguess_compare_value_columns.include_query- If True andqueryis present, join one query percase_index.include_reference- Same forreference.
Returns:
Wide DataFrame indexed by case_index.
Raises:
ValidationError- If required columns are missing or pivot inputs are invalid.
summarize_by_agent
def summarize_by_agent(df: pd.DataFrame) -> pd.DataFrame
Per-agent row counts, failure counts, and means of numeric metric columns.
Non-numeric metric columns (e.g. string scores) are omitted from means.
Columns ending with __metric_pass add pass_rate__, n_passed__,
and n_evaluated__ fields (threshold pass/fail) per agent.
agent_run_failed is coerced from strings when loaded from CSV.
Arguments:
df- Long-format evaluation results.
Returns:
One row per agent_name.
Raises:
ValidationError- Ifagent_nameis missing.
case_rows
def case_rows(df: pd.DataFrame, case_index: int) -> pd.DataFrame
Return long-format rows for a single case_index.
case_comparison_html
def case_comparison_html(df: pd.DataFrame,
case_index: int,
*,
max_output_chars: Optional[int] = 8000) -> str
Build a simple HTML table comparing agents for one case (for notebooks).