coder-company/sarvam-code-codex-analysis

GitHub: coder-company/sarvam-code-codex-analysis

该项目通过可重现的静态分析和多层证据体系,对 Sarvam Code 二进制文件进行了源自 OpenAI Codex 的技术溯源与许可证合规性验证。

Stars: 0 | Forks: 0

# Sarvam Code / OpenAI Codex 技术溯源分析 本代码库包含对 Sarvam Code v0.38.0 以及基于 Apache-2.0 许可证的 [OpenAI Codex](https://github.com/openai/codex) Rust 代码库的可重现静态分析。 阅读[完整技术报告](REPORT.md)。如需不带逆向工程术语的简短说明,请参阅 [Sarvam Code 溯源解释](https://github.com/coder-company/sarvam-code-provenance-explained)。 ## 主要结果 经过分析,可以极高的技术确信度断定,受分析的 Sarvam Code 二进制文件派生自 OpenAI Codex。 该结论基于 996 个完全一致的上游源码字面量、48 处系统性的品牌替换、相匹配的命令与架构表面、 保留的 OpenAI 引用,以及 MCP OAuth 子系统中的针对性实现上下文。 派生并不等同于盗窃。Apache License 2.0 允许在满足条件的情况下进行修改和重新分发。 本报告并未得出 Sarvam 侵犯版权或违反许可证的结论。 ## 代码库映射 - [`REPORT.md`](REPORT.md) — 发现、方法论、注意事项及参考 - [`evidence/source-literal-matches.tsv`](evidence/source-literal-matches.tsv) — 所有的精确匹配和品牌替换匹配 - [`evidence/version-fingerprint-scores.tsv`](evidence/version-fingerprint-scores.tsv) — 跨 37 个 Codex 发布标签的比较 - [`evidence/cli-help-normalized.diff`](evidence/cli-help-normalized.diff) — 标准化的 CLI 比较 - [`evidence/targeted-control-flow.txt`](evidence/targeted-control-flow.txt) — 针对性的 Ghidra 导出 - [`scripts/source_fingerprint.py`](scripts/source_fingerprint.py) — 可重现的扫描器 - [`evidence/PUBLIC-SHA256SUMS`](evidence/PUBLIC-SHA256SUMS) — 已发布证据的校验和 ## 已识别的目标 - SHA-256: `6a23109a27d702e6ef5245de157150174445d1f407896cee44b6831dadf55c68` - ELF build ID: `932f528bbba83ac425182c07b45871f3` - 报告的发布渠道版本: `0.38.0` 用于可重现扫描的精简目标,其 SHA-256 为 `07110e0631cfc55cb579e9e3cd099f2b87ac634b48c60cfa4596ccf732d78092`。 ## 上游基线 - 代码库: - Commit: `b545c94041017d000e2c8b2f6272705d21b85dfb` - 许可证: Apache License 2.0 ## 证据标准 本报告区分了以下几点: 1. 精确的字节和字符串对应关系; 2. 带有明确品牌替换的近乎逐字的对应关系; 3. 结构和针对性的实现对应关系; 4. 常见的第三方依赖行为; 5. 不支持的推论。 Ghidra 输出是经过重构的类 C 伪代码,源自一个已剥离符号且经过优化的 Rust 可执行文件。 它并非原始的 Rust 源代码。 ## 为什么不提交二进制文件 本代码库不分发 Sarvam 可执行文件、OpenAI 发布的二进制文件、Ghidra 发行版或多 GB 的分析数据库。 它们的加密哈希值标识了确切的输入。请从其发布者处获取软件,验证哈希值,并在本地运行已发布的扫描器。
标签:Cutter, ELF分析, 云安全监控, 云资产清单, 代码溯源, 可视化界面, 后端开发, 开源合规, 软件供应链, 逆向工具, 逆向工程, 静态分析