2026年8月時点で、AlphaMoatはAIオブザーバビリティ・評価タグの付いたAIサイトを367件掲載しています。最も訪問されたのはArenaで、月間訪問数は2994万(前月比-7%)です。最新の月間トラフィックで並べ、毎月更新しています。
| # | プロダクト | 企業 | 業界 | 訪問数 | 前月比 |
|---|---|---|---|---|---|
| 1 | コミュニティの投票から作られた公開LLMリーダーボードです | LMArena | ニュース・分析 | 2994万 | -7% |
| 2 | AIモデルとAPIプロバイダーの性能を独立して比較するサイト。 | Artificial Analysis | 汎用AI | 768.8万 | +25.8% |
| 3 | あらゆる技術スタック向けのAIオブザーバビリティ・セキュリティプラットフォーム。 | Datadog | プログラミング | 570.7万 | -6.2% |
| 4 | 製品課題を診断し、エラーを修正し、コード変更を自動生成するプラットフォーム | PostHog | プログラミング | 335.6万 | +3.5% |
| 5 | 開発チームがエラーを発見し、アプリケーションのパフォーマンスを監視できるように支援します。 | Sentry | プログラミング | 299.8万 | -8.4% |
| 6 | 人間の専門性と技術を組み合わせた学習データ基盤 | Toloka | 汎用AI | 238.8万 | -9.2% |
| 7 | 機械学習の実験ワークフローを追跡・可視化・改善します。 | Weights & Biases | 汎用AI | 198.8万 | -4.6% |
| 8 | 複数のAIモデルのデザインを生成して比較する競技プラットフォーム | Design Arena | 汎用AI | 127.4万 | -11.3% |
| 9 | GPT、Claude、Gemini、Llama などを一つのページで比較する、独立した AI モデル・リーダーボード。 | LLM Stats | 汎用AI | 115.5万 | +5.6% |
| 10 | メトリクス、ログ、トレースを統一し、トラブル解決を支援するクラウドプラットフォーム。 | Grafana | プログラミング | 114.8万 | -9.6% |
| 11 | CodexなどのAIコーディングアカウント向けに、検証データとコミュニティの経験を集約するレーダーステーション | CodexRadar | 汎用AI | 94.6万 | +3.2% |
| 12 | Harness | プログラミング | 87.2万 | -2.2% | |
| 13 | 本番環境対応の OpenAI 互換AIゲートウェイで、マルチモデルのルーティングを統一します。 | OrcaRouter | 汎用AI | 83.3万 | +931.4% |
| 14 | 本番AIエージェントのオープンソース追跡・評価・継続的改善。 | Langfuse | 汎用AI | 82.9万 | -13.4% |
| 15 | 知的計算モデルの能力と業界の発展動向を研究しています。 | Epoch AI | ニュース・分析 | 60.9万 | +12.3% |
| 16 | 信頼できる知能システム構築のため訓練データ・評価・フルスタック技術を提供 | Scale | 汎用AI | 57万 | -4.3% |
| 17 | インシデント対応、オンコール、ログ・メトリクス管理を統合するAI SRE。 | Better Stack | プログラミング | 55万 | +2.7% |
| 18 | 本番環境グレードのエージェントのためのエンドツーエンドAIエンジニアリングスタック。 | Pydantic | プログラミング | 45.4万 | -15.3% |
| 19 | 最先端AIの能力リスクと実業務への影響を独立して評価する組織。 | METR | 汎用AI | 44.7万 | +76.2% |
| 20 | AIアプリとエージェントを追跡、評価、デバッグ、改善 | Comet ML | 汎用AI | 28.3万 | -30.7% |
| 21 | オープンで利用可能、拡張可能な大規模モデルシステムを育成する。 | LMSYS | 汎用AI | 26.8万 | -7.4% |
| 22 | AI時代のソフトウェア向けに、テレメトリーを統一し高速な観測クエリを提供。 | Hound Technology | 汎用AI | 24万 | -19.1% |
| 23 | 評価をリアルタイムで追跡し、AIエージェントの回帰問題を特定。 | Braintrust | 汎用AI | 23.9万 | -16.2% |
| 24 | 個人とチームのAIコーディング活動とコストを定量可視化 | WakaTime | プログラミング | 23.6万 | -20.2% |
| 25 | 本番環境のAIエージェントを改善するため継続的に追跡・評価・実験する。 | Arize AI | 汎用AI | 23.5万 | -8% |
| 26 | 生成AIアプリ向けにゲートウェイ、ルーティング、ロギング、プロンプト管理を提供。 | Portkey | 汎用AI | 22.6万 | -15% |
| 27 | 実際の人間のフィードバックを集め、音声と会話AIを継続的に評価するプラットフォーム。 | Hume AI | 音声 | 21.1万 | -20.4% |
| 28 | エージェント、LLM、MLを管理、評価、監視するオープンソースプラットフォーム。 | MLflow | 汎用AI | 18.6万 | -19.2% |
| 29 | マルチモーダル学習データ・エージェントトレース・LLM評価のオープンソースラベリング。 | HumanSignal | 汎用AI | 18.6万 | -3.7% |
| 30 | 最先端LLMのためのデータ開発・評価インフラ | Snorkel AI | 汎用AI | 18.5万 | -6.9% |
| 31 | ネットワーク・アイデンティティ・クラウド・AI環境全体のリアルタイム攻撃シグナルを発見 | Vectra | プログラミング | 17.6万 | +1.7% |
| 32 | An AI observability and evaluation engineering platform. | Galileo | 汎用AI | 17.3万 | -8.1% |
| 33 | Independent AI evaluation benchmark platform | Vals | 汎用AI | 16.7万 | -11.3% |
| 34 | 生成AIエージェントをリアルタイムでシミュレーション・評価・監視 | H3 Labs | 汎用AI | 16.2万 | +38.6% |
| 35 | 一つのプロンプトを25モデルに送り、合意を比較するツールです。 | PromptQuorum | 汎用AI | 16.1万 | +20.2% |
| 36 | LLMアプリとエージェント向けのオープンソース評価とレッドチーム | Promptfoo | 汎用AI | 15.8万 | -13.7% |
| 37 | LLM・検索拡張・機械学習システム向けのオープンソース評価・監視 | Evidently AI | 汎用AI | 15.7万 | -5.8% |
| 38 | LLMプロンプトのバージョンを記録、評価、管理。 | PromptLayer | 汎用AI | 11.9万 | -10.9% |
| 39 | 本番環境のAIエージェントを模擬・評価・監視・改善 | Future AGI | 汎用AI | 11.7万 | +43.3% |
| 40 | エンタープライズ向けにLLM評価、トレーシング、本番可観測性を統合。 | Confident AI | 汎用AI | 11.5万 | -1.3% |
| 41 | 物理 AI 向けのマルチモーダルデータキュレーションプラットフォーム | Voxel51 | 汎用AI | 10.8万 | -17.7% |
| 42 | 本番の障害を特定し、修正のためにコーディングエージェントを派遣するオープンソースの可観測性プラットフォーム | Latitude | 汎用AI | 10.1万 | -18.6% |
| 43 | 本番のAIモデルとプロンプトを観測、評価、管理します。 | Keywords AI | 汎用AI | 8.9万 | +28.8% |
| 44 | 大モデルのリクエストを一箇所でルーティング・監視するLLMOpsプラットフォーム | Helicone | 汎用AI | 8.5万 | -17.3% |
| 45 | EU-hosted unified AI agent gateway across models | Opper | 汎用AI | 8.2万 | +5.2% |
| 46 | マルチモーダル収集・ラベリング・評価を網羅するエンタープライズ級 AI データと実装サービス。 | YPAI | 汎用AI | 8万 | +7.2% |
| 47 | A free AI paper-review tool from Stanford. | Stanford Agentic Reviewer | 教育・研究 | 7.1万 | -42.8% |
| 48 | 主権級のAIゲートウェイとエージェントプラットフォーム | Orq.ai | 汎用AI | 7万 | +0.8% |
| 49 | ボイス・会話エージェント向けの自動テストプラットフォーム | Cekura | 汎用AI | 6.6万 | +35.5% |
| 50 | 実際のコーディング課題に基づくAIモデルベンチマーク。 | World of AI Bench | 汎用AI | 6.4万 | +50.8% |
2026年8月時点で、月間訪問数で見ると、「AIオブザーバビリティ・評価」関連のサイトの1位はArena(月間訪問 2994万)です。続いてArtificial Analysis(月間訪問 768.8万)、Datadog(月間訪問 570.7万)。
月間訪問数の高い順に、上位10件は次のとおりです:1. Arena、2. Artificial Analysis、3. Datadog、4. PostHog、5. Sentry、6. Toloka、7. Prompts、8. Design Arena、9. LLM Stats、10. Grafana Labs。
AlphaMoatは367件の「AIオブザーバビリティ・評価」関連のサイトを収録し、月間訪問数で順位付けしています。訪問数は第三者によるトラフィック推計値を月単位で集計したもので、同一プロダクトの複数ドメインは統合しています。データは毎月更新しており、現在は2026年8月のデータです。
データ月:2026-08 · 訪問数は第三者によるトラフィック推計値を月単位で集計したもので、規模と傾向の把握に適しています。同一プロダクトの複数ドメインは統合しています。詳しくはデータの方法論をご覧ください。