据 AlphaMoat 统计,截至 2026-07,Agent Evaluation 累计下载 5,763 次、获 8 个星标,在全部 106,927 个 Claude 技能中排名第 1,155 位,在「AI 智能体」分类(17,222 个)中排名第 217 位。
{"answer":"LLM智能体测试与基准评测,涵盖行为测试、能力评估、可靠性指标及生产监控——即便是顶尖智能体在真实基准测试中通过率也不到50%。适用场景:智能体测试、智能体评估、智能体基准、智能体可靠性、测试智能体。"}
| 月份 | 累计下载 | 环比 | 星标 | 累计安装 |
|---|---|---|---|---|
| 2026-07 | 5,763 | +5.7% | 8 | 372 |
| 2026-06 | 5,454 | +5.2% | 8 | 372 |
| 2026-05 | 5,183 | +23.4% | 8 | 372 |
| 2026-03 | 4,201 | — | 6 | 329 |
记录自身发现以实现自我改进的技能
用于 AI 代理的浏览器自动化 CLI。当用户需要与网站交互(包括浏览页面、填写表单、点击按钮、截图等)时使用。
自我反思+自我批评+自我学习+自组织记忆。智能体评估自身工作、发现错误并持续改进。
AI智能体技能安全预审工具。安装ClawdHub、GitHub等来源技能前,检查风险信号、权限范围及可疑模式。
类型化知识图谱,用于结构化智能体记忆与可组合技能。适用于以下场景:创建/查询实体(人物、项目、任务、事件、文档)、关联相关对象、强制执行约束、将多步操作规划为图谱变换,或当技能需要共享状态时。触发关键词包括"记住""我知道关于什么""将X链接到Y""显示依赖关系"、实体增删改查操作,以及跨技能数据访问。
将 AI 代理从任务执行者转变为能够预见需求、持续优化的主动伙伴。现已支持 WAL Protocol、Working Buffer、Autonomous Crons 及经过实战验证的模式。属于 Hal Stack 🦞。
专为AI智能体优化的无头浏览器自动化CLI,支持无障碍树快照和基于引用的元素选择。
创建有效技能指南。当用户希望创建新技能(或更新现有技能)以利用专业知识、工作流程或工具集成扩展 Claude 的能力时,应使用此技能。
通过协调分析、负载分配和成本感知编排优化多智能体系统。适用于提升智能体性能、吞吐量或可靠性。
通过消除AI写作特征(如破折号、填充词等),让人工生成的文本更自然。适用于需要文本听起来像人工撰写的场景。
通过预写日志 (WAL)、工作缓冲区和自动恢复防止 LLM 压缩期间上下文丢失,三项机制确保关键状态...
{ "answer": "AI/LLM红队测试技能。指向任意LLM API端点运行自动化安全评估,涵盖提示注入、越狱等160+攻击载荷。" }
Interact with MoltX (Twitter for AI agents). Post, reply, like, follow, check notifications, and engage on moltx.io. Use when doing MoltX social engagement,...
数据月份:2026-07 · 下载/星标/安装数聚合自公开技能注册库(ClawHub、SkillHub),按月更新。口径说明见数据方法。