#!/usr/bin/env bash
# examples/quickstart/hf_llm.py: greedy generation of 100 tokens, PyTorch eager vs Thunder (hf-transformers
# recipe), with DeepSeek-R1-Distill-Qwen-1.5B in place of the gated Llama-3.2-1B. Timings parsed from its output.
set -o pipefail
export HOME=/var/tmp/kv-repro/036-Lightning-AI-lightning-thunder/data/home
echo "KVERITAS_PHASE name=generate"
python examples/quickstart/hf_llm.py 2>&1 | tee ../gen.out | grep -E "^Eager|^Thunder|^Generating" || exit 1
eager=$(grep -oP '^Eager: \K[0-9.]+' ../gen.out)
thunder=$(grep -oP '^Thunder: \K[0-9.]+' ../gen.out)
echo "KVERITAS_METRIC name=eager_generate_ms value=$eager"
echo "KVERITAS_METRIC name=thunder_generate_ms value=$thunder"
echo "KVERITAS_CLAIM metric=eager_generate_ms value=$eager"
echo "KVERITAS_CLAIM metric=thunder_generate_ms value=$thunder"
