{
  "video_id": "dcb4c8a5e0a0b513",
  "channel": "export-arxiv-org-rss-cs-ai",
  "title": "Constructing Evaluation Datasets for Procedural Reasoning: Balancing Naturalness, Grounding, and Multi-Hop Coverage",
  "scores": {
    "depth": 3,
    "novelty": 2,
    "aria_relevance": 3,
    "production_ready": 2
  },
  "junk_penalty": 0,
  "avg_score": 2.5,
  "effective_score": 2.5,
  "verdict": "promote",
  "one_line_reason": "Rigorous eval-dataset construction framework with TMK-grounding validation; directly applicable to Aria's multi-hop reasoning & eval-setup needs; empirical validation across 690 QA pairs demonstrates systematic approach to representation-aware dataset quality.",
  "model": "claude-haiku-4-5-20251001",
  "cost_usd": 0.001811,
  "triaged_at": "2026-06-12T15:02:17.667154+00:00"
}