从真实问题出发,记录不同模型在同一 Agent 下的表现。选一个实验,看结果,也看证据。
同一个 Agent,观察不同模型如何完成真实开发任务。
从一个真实漏洞出发,比较模型的修复结果,追查原题通过后仍存在的客户端复制缺口。
粘贴一个任务 Prompt,识别任务类型,比较 AIHubMix 模型的上下文、Token 消耗和完成费用。