feat(skills): install deepeval skill from confident-ai/deepeval
Adds the deepeval eval-loop skill via `npx skills add` with skills-lock.json for reproducible reinstalls. Symlinked to Claude Code via .claude/skills/. Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com> Claude-Session: https://claude.ai/code/session_016z2ZFYHQCex8yZAMVMTZzZ
This commit is contained in:
28
.agents/skills/deepeval/templates/test_multi_turn_e2e.py
Normal file
28
.agents/skills/deepeval/templates/test_multi_turn_e2e.py
Normal file
@@ -0,0 +1,28 @@
|
||||
from importlib import import_module
|
||||
|
||||
import pytest
|
||||
|
||||
from deepeval import assert_test
|
||||
from deepeval.dataset import EvaluationDataset
|
||||
from deepeval.simulator import ConversationSimulator
|
||||
|
||||
from metrics import MULTI_TURN_METRICS
|
||||
|
||||
MAX_TURNS = 10
|
||||
ai_app = import_module("ai_app")
|
||||
|
||||
|
||||
simulator = ConversationSimulator(model_callback=ai_app.chatbot_callback)
|
||||
dataset = EvaluationDataset()
|
||||
dataset.add_goldens_from_json_file(file_path="tests/evals/.dataset.json")
|
||||
|
||||
|
||||
@pytest.mark.parametrize(
|
||||
"test_case",
|
||||
simulator.simulate(
|
||||
conversational_goldens=dataset.goldens,
|
||||
max_user_simulations=MAX_TURNS,
|
||||
),
|
||||
)
|
||||
def test_multi_turn(test_case):
|
||||
assert_test(test_case=test_case, metrics=MULTI_TURN_METRICS)
|
||||
Reference in New Issue
Block a user