評価のすべてのツール(12件)
- Langfuseオープンソースの LLM トレースと評価。Cloud Hobby は $0。Core は席あたり $29。Pro は席あたり $199。含む分のあとは従量。
- LangSmithトレース、評価、デプロイ用の LangChain Cloud。Plus は席あたり $39。Startup は月 $1,400。LangSmith Engine は月 $2,000。
- Microsoft ThinkingBoxMicrosoft製のオープンソースサンドボックス兼ベンチマーク。ステートフルな業務タスクをAIエージェントが安定して完了できるかを検証し、発見と信頼性のギャップを示す。
- GarakNVIDIAが開発するオープンソースのLLM脆弱性スキャナー。数十のプラグインと数千のプロンプトで、脱獄・プロンプトインジェクション・データ漏洩を検出。モデルとエージェントのセキュリティテストの業界標準。
- NVIDIA NeMo GuardrailsNVIDIAが開発するオープンソースのプログラマブル・ガードレールツールキット。ColangフローでLLM対話アプリの入出力・対話・検索ガードレールを定義し、脱獄やプロンプトインジェクションを防ぐ。
- magiオープンソースのターミナル向けコーディングエージェント。エージェントに「完成」を証明させ、3 人の監査役からなる評議会が証拠が結論を裏付けるか投票。
- HuggingFace Evaluation標準メトリクス、ベンチマーク、AIモデルの包括的パフォーマンス分析を備えたモデル評価ツール。HuggingFace Evaluation(skills)の機能・料金・代替ツールを比較できます。
- Linus Torvalds SkillLinus Torvalds Skill は CC0 のコードレビュー技能パックで、31,397 通の LKML メールからモデル別 SKILL.md を 4 つ蒸留する。
- Peer Review Skill方法論、統計、設計、再現性、倫理を評価するための体系的ピアレビューツールキット。Peer Review Skill(skills)の機能・料金・代替ツールを比較できます。
- Requesting Code Review Skillコードレビューのサブエージェントをディスパッチして、問題が拡大する前に捉える - 早期レビュー、頻繁なレビュー。Requesting Code Review Skill(skills)の機能・料金・代替ツールを比較できます。
- Scholar Evaluation SkillScholarEval フレームワークを適用して学術作品を系統的に評価 - 構造化されたスコアリングとフィードバックによる研究品質次元全体の包括的分析。
- Scientific Critical Thinking Skill研究の厳密さを系統的に評価 - GRADE と Cochrane ROB を使用して方法論、実験デザイン、統計的妥当性、バイアス、交絡、エビデンスの質を評価。
すべてのタグ
A2AプロトコルAIアシスタントAIエージェントAIコンテンツAI検索AI決済AlibabaAnthropicAPIAWSBAAIBlack Forest LabsByteDanceClaudeClaude CodeCLICloudflareCodexCohereCursorDeepgramDeepSeekElevenLabsFLUXGeminiGemmaGitGoGoogleGPTGPUGrokHugging FaceIBMJina AIKimiLangChainLangGraphLinuxLlamamacOSMarkdownMCPMetaMicrosoftMiniMaxMistralMixedbread AIMoEMoonshot AINous ResearchNVIDIAObsidianOpenAIOpenClawOpenCodeOpenHandsOpenRouterPerplexityPythonQwenRAGReplitRustStability AITencentTypeScriptVoyage AIxAIZhipu AIエージェントウォレットエージェントオーケストレーションエージェントフレームワークエージェントランタイムエンタープライズエンベディングオープンウェイトオープンソースクラウドコーディングエージェントコードアシスタントコードレビューコード品質コミュニケーションコンピューター操作サンドボックスステーブルコインスプレッドシートセキュリティセルフホストソーシャルメディアチャットボットデータサイエンスデータベースデータ可視化ディープリサーチデザインテストデバッグデプロイドキュメントドキュメント処理ナレッジベースノーコード/ローコードファインチューニングプライバシーブラウザ自動化プレゼンテーションプロジェクト管理プロトコルフロンティアモデルベクトルデータベースマルチエージェントマルチモーダルモデルルーティングライティングリアルタイムリランキングローカルAIワークフロー健康動画動画生成可観測性多言語推論教育暗号資産とWeb3生産性画像生成研究統合自動化評価
評価 にタグ付けされた項目 (12 個)
Month Visit2000000DR: 93AS: 95
Month Visit1500000DR: 90AS: 90
Month Visit1000DR: 80AS: 80
Month Visit1000DR: 80AS: 80
Month Visit1000DR: 80AS: 80
Month Visit1000DR: 80AS: 80
Month Visit1000DR: 80AS: 80
Month Visit1000DR: 80AS: 80
Month Visit1000DR: 80AS: 78
Month Visit1000DR: 70AS: 68
Month Visit1000DR: 70AS: 68