ProblemWhich LLM gives the best cost-speed-quality tradeoff for different production workloads?
ApproachConfig-driven benchmark comparing GPT, Claude Sonnet, Gemini Flash, and Llama across summarization, classification, RAG QA, and code generation. Measured quality (ROUGE-L, Macro-F1, pass@1) vs. operational cost (tokens, latency, USD). Shipped Streamlit dashboard with budget-constrained model recommender.
Outcome: no single model dominates — model selection should vary by task type, budget, and quality constraints. Demonstrated across 4 task categories with per-request telemetry.