Leviathan logo

Leviathan

打开

开源 CLI 与可选 MCP 服务器,让 AI Agent 从大型本地记录集中获得带引用、按相关性排序的答案。

分享:
查看替代方案

Leviathan

Leviathan 是面向需要处理大规模运营记录的 Agent 的开源本地优先检索工具。它可以把 JSONL、JSON、CSV、TSV、SQLite 数据或数据库 CLI 的输出转成基于 SQLite 的全文索引。与其把整段日志直接塞给 Agent,search 命令会返回带引用、按相关性排序的短卡片。首个稳定版 v0.1.0 于 2026 年 10 月 6 日发布,采用 Apache-2.0 许可证。

核心功能

  • 输入范围广:可索引 JSONL、JSON、CSV、TSV、SQLite,或由 psql、DuckDB 等工具流式输出的结构化数据。
  • 理解字段映射:leviathan init 会推断并生成带注释的配置;映射可指定 ID、标题、文本、分组、日期、过滤字段和展示字段。
  • 紧凑且可追溯的检索:search、recent、resolve 和 get 返回聚焦的记录卡片,而不是整份历史原文。分组无法唯一匹配时会提示歧义,而不是静默猜测。
  • 面向 Agent 的集成:可让 Agent 使用 CLI 与仓库 Skill,也可运行 leviathan mcp,提供搜索、分组解析、记录读取和索引描述四个只读 MCP 工具。
  • 本地运行:官方说明索引保存在一个 SQLite 文件中;它可以读取数据库 CLI 输出,而不自行持有数据库凭据。

适用场景

Leviathan 面向需要从工单、事故日志、CRM 导出或设备维护历史中回答问题的编码 Agent、客服 Agent 和内部助手。一个实用流程是先导出有边界的数据集,用 leviathan init 检查字段,再用配置文件建立索引,并把 CLI Skill 交给 Agent。之后 Agent 可先按客户、设备或项目分组搜索,再读取支撑答案的记录。

仓库附带合成维护日志的基准测试。其公开的百万记录结果为:答案上下文中位数 436 token、前五名包含相关记录的比例 99.0%、中位延迟 33 ms。这是项目自行发布的基准,不应当作独立产品对比;数据生成方式、测试方法、硬件和限制均已在仓库中公开。

安装与定价

Leviathan 使用 Apache-2.0 许可证。官方文档提供 cargo install leviathan-index、从 Git 仓库安装,以及 GitHub Releases 中的预编译二进制文件。此次核验的官方资料中没有托管服务或价格页;成本主要来自本地机器、索引存储,以及外围的数据导出流程。

局限与风险

  • 它刚发布 v0.1.0,团队在将其作为生产依赖前应验证索引行为和发布节奏。
  • 检索质量取决于正确的字段映射和源记录结构,不能代替权限控制或源数据质量治理。
  • 基准采用合成数据;不要直接外推到所有数据集,应复现官方测试或用代表性数据验证。

快速开始

cargo install leviathan-index
leviathan init ./export
leviathan index tickets.csv --id "Ticket ID" --group customer_id --date created_at
leviathan search -g acme "sso login loop after password reset"

建议先从不含敏感信息的导出数据开始,并在接入 Agent 前检查返回卡片。数据库数据应由数据库客户端保存凭据,仅把计划建立索引的行通过管道交给 Leviathan。

常见问题

Leviathan 是托管向量数据库吗?

不是。官方将其描述为构建 SQLite 索引的本地静态二进制程序,可通过 CLI 或可选的只读 MCP 服务器使用。

建索引需要 LLM 吗?

文档所述的索引和搜索工作流是本地全文检索。Agent 使用它时,LLM 会消费返回卡片,但官方并未将 LLM 列为构建索引的必要条件。

有哪些替代方案?

  • Hindsight:用 LLM 抽取和整合事实的 Agent 记忆系统。
  • AgentMemory:面向编码 Agent 的本地记忆层。
  • Letta:带托管选项的有状态 Agent。

总结

当 Agent 必须搜索大规模、结构化的本地历史记录,而不适合将它们全部塞进上下文时,Leviathan 是一个聚焦的选择。先阅读官方 README与基准方法,再使用具有代表性且受访问控制的导出数据进行测试。

评论

还没有评论。成为第一个评论的人!