debxylen/distrack

GitHub: debxylen/distrack

一个 Discord 对话索引与分析 pipeline,通过向量检索和 Agent 合成,持续扫描、结构化并生成每日简报与长期记忆事实。

Stars: 0 | Forks: 0

# distrack 一个用于 Discord 的 OSINT 对话索引和分析 pipeline。它会持续扫描、结构化、进行向量索引,并为配置的用户跨共同 server 生成每日简报。 ``` [ Discord ] │ ▼ [ scan.py ] ──► JSON scan data (data/) │ ├───────────────────────┬────────────────────────┐ ▼ ▼ ▼ [ retrieval.py ] [ hourly.py ] [ facts.py ] Vector database Annotated hourly notes Long-term memory facts (sqlite-vec) (reports/hourly/) (sqlite-vec) │ │ │ └───────────────────────┼────────────────────────┘ ▼ [ daily.py ] Agentic synthesis loop │ ┌─────────┴─────────┐ ▼ ▼ Markdown report Discord Webhook (reports/daily/) (reports/briefs/) ``` ## 待办事项 - 用于查询收集到的信息的交互式 agent - 更丰富的数据源,例如 Rich Presence、Activity 和 Status - 每小时执行摘要 - 可能但可能性较小的,一个 web dashboard 我太懒了 ## 成本与效率 使用 `qwen/qwen3.7-flash` 和 `qwen/qwen3-embedding-8b` 的平均运行数据: - 每小时扫描与处理:每个活跃小时约 `~$0.0015`。空闲时段不会产生 API 成本。 - 每日 Agent 简报:每个合成的日期约 `~$0.001`。 ## 状态与问题 这个项目还比较新,因此尚未经过长达数月的高强度多 server 社区压力测试。 如果在运行数月后不可避免地出现了问题,请提交一个 Issue 或私信我。 ## 隐私 distrack 旨在用于分析操作者已获得适当授权的 Discord 数据。 它不会: - 绕过 Discord 权限 - 抓取不可用的内容 - 突破 server 隐私控制 我对您做出的任何愚蠢行为概不负责。 ## 设置与使用 ### 前置条件 - Python 3.10+ - 已安装 ripgrep (`rg`) 并在系统的 `PATH` 中可用 - 一个有权访问共同 channel 的 Discord user-bot token ### 安装说明 ``` git clone https://github.com/debxylen/distrack.git cd distrack pip install -r requirements.txt ``` ### 配置 1. 将 `.env.example` 复制为 `.env`: cp .env.example .env 并填入你的密钥。 2. 将 `config.example.json` 复制为 `config.json`: cp config.example.json config.json 并填写内容。 ### 运行说明 用于自动扫描和每日简报循环: ``` python main.py ``` 也可以针对每个脚本使用手动 CLI: ``` python -m src. ``` ## 许可证 基于 GNU GPLv3 授权。详见 [LICENSE](LICENSE)。
标签:AI智能体, Discord, ESC4, OSINT, 代码示例, 向量数据库, 命令控制, 数据分析, 数据采集, 逆向工具