AGENT EXPERIMENTS

Agent 实验室

从真实问题出发,记录不同模型在同一 Agent 下的表现。选一个实验,看结果,也看证据。

Hermes

1 项实验

同一个 Agent,观察不同模型如何完成真实开发任务。

EP 01安全修复

凭据泄漏修复:通过测试之后

从一个真实漏洞出发,比较模型的修复结果,追查原题通过后仍存在的客户端复制缺口。

  • 9 个模型
  • 18 次主实验
  • 2 次延时探针

即将加入

  • PI下一组 Agent 实验。
  • 更多 Agent后续实验会按 Agent 持续加入。
UTILITY

Prompt 任务估算器

粘贴一个任务 Prompt,识别任务类型,比较 AIHubMix 模型的上下文、Token 消耗和完成费用。

打开估算器 →