coder-company/sarvam-code-codex-analysis
GitHub: coder-company/sarvam-code-codex-analysis
该项目通过可重现的静态分析和多层证据体系,对 Sarvam Code 二进制文件进行了源自 OpenAI Codex 的技术溯源与许可证合规性验证。
Stars: 0 | Forks: 0
# Sarvam Code / OpenAI Codex 技术溯源分析
本代码库包含对 Sarvam Code v0.38.0
以及基于 Apache-2.0 许可证的
[OpenAI Codex](https://github.com/openai/codex) Rust 代码库的可重现静态分析。
阅读[完整技术报告](REPORT.md)。如需不带逆向工程术语的简短说明,请参阅
[Sarvam Code 溯源解释](https://github.com/coder-company/sarvam-code-provenance-explained)。
## 主要结果
经过分析,可以极高的技术确信度断定,受分析的 Sarvam Code 二进制文件派生自 OpenAI Codex。
该结论基于 996 个完全一致的上游源码字面量、48 处系统性的品牌替换、相匹配的命令与架构表面、
保留的 OpenAI 引用,以及 MCP OAuth 子系统中的针对性实现上下文。
派生并不等同于盗窃。Apache License 2.0 允许在满足条件的情况下进行修改和重新分发。
本报告并未得出 Sarvam 侵犯版权或违反许可证的结论。
## 代码库映射
- [`REPORT.md`](REPORT.md) — 发现、方法论、注意事项及参考
- [`evidence/source-literal-matches.tsv`](evidence/source-literal-matches.tsv)
— 所有的精确匹配和品牌替换匹配
- [`evidence/version-fingerprint-scores.tsv`](evidence/version-fingerprint-scores.tsv)
— 跨 37 个 Codex 发布标签的比较
- [`evidence/cli-help-normalized.diff`](evidence/cli-help-normalized.diff) —
标准化的 CLI 比较
- [`evidence/targeted-control-flow.txt`](evidence/targeted-control-flow.txt) —
针对性的 Ghidra 导出
- [`scripts/source_fingerprint.py`](scripts/source_fingerprint.py) —
可重现的扫描器
- [`evidence/PUBLIC-SHA256SUMS`](evidence/PUBLIC-SHA256SUMS) — 已发布证据的校验和
## 已识别的目标
- SHA-256: `6a23109a27d702e6ef5245de157150174445d1f407896cee44b6831dadf55c68`
- ELF build ID: `932f528bbba83ac425182c07b45871f3`
- 报告的发布渠道版本: `0.38.0`
用于可重现扫描的精简目标,其 SHA-256 为
`07110e0631cfc55cb579e9e3cd099f2b87ac634b48c60cfa4596ccf732d78092`。
## 上游基线
- 代码库:
- Commit: `b545c94041017d000e2c8b2f6272705d21b85dfb`
- 许可证: Apache License 2.0
## 证据标准
本报告区分了以下几点:
1. 精确的字节和字符串对应关系;
2. 带有明确品牌替换的近乎逐字的对应关系;
3. 结构和针对性的实现对应关系;
4. 常见的第三方依赖行为;
5. 不支持的推论。
Ghidra 输出是经过重构的类 C 伪代码,源自一个已剥离符号且经过优化的 Rust 可执行文件。
它并非原始的 Rust 源代码。
## 为什么不提交二进制文件
本代码库不分发 Sarvam 可执行文件、OpenAI 发布的二进制文件、Ghidra 发行版或多 GB 的分析数据库。
它们的加密哈希值标识了确切的输入。请从其发布者处获取软件,验证哈希值,并在本地运行已发布的扫描器。
标签:Cutter, ELF分析, 云安全监控, 云资产清单, 代码溯源, 可视化界面, 后端开发, 开源合规, 软件供应链, 逆向工具, 逆向工程, 静态分析