hardikdixit123/Fake-Job-Posting-Identifier
GitHub: hardikdixit123/Fake-Job-Posting-Identifier
基于NLP与机器学习的虚假招聘信息检测系统,通过分析职位描述与可疑特征自动判别招聘帖真伪。
Stars: 0 | Forks: 0
# 虚假招聘信息识别器
这是一个基于 AI/ML 的欺诈检测系统,旨在利用自然语言处理(NLP)、特征工程和机器学习技术来识别虚假的在线招聘信息。该系统通过分析职位描述、公司详情、电子邮件域名以及可疑的语言模式,将招聘信息分类为真实或虚假。
## 功能
- **机器学习 Pipeline**
- 使用 TF-IDF Vectorization 和 Random Forest Classification 构建,用于准确的基于文本的欺诈检测。
- **高级特征工程**
- 检测可疑关键词、紧急性短语、个人电子邮件域名以及网站不一致性。
- **自然语言处理**
- 包含文本预处理技术,例如使用 NLTK 进行 tokenization、stopword 去除、lemmatization 和文本清理。
- **交互式 Web 应用程序**
- 开发了基于 Streamlit 的 UI,用于实时的虚假招聘预测和特征分析。
## 项目结构
```
fake-job-posting-identifier/
│
├── app.py # Streamlit application
├── src/
│ ├── preprocess.py # NLP preprocessing functions
│ ├── features.py # Feature engineering logic
│ └── train.py # Model training pipeline
│
├── models/ # Saved ML models
├── data/ # EMSCAD dataset
├── screenshots/ # UI screenshots
├── requirements.txt
└── README.md
```
## 截图
### 主界面

### 真实招聘检测

### 虚假招聘检测
## 
## 如何在本地运行
### 1. 克隆仓库
```
git clone https://github.com/YOUR_USERNAME/fake-job-posting-identifier.git
cd fake-job-posting-identifier
```
### 2. 安装依赖
```
pip install -r requirements.txt
```
### 3. 运行应用程序
```
streamlit run app.py
```
### 4. 在浏览器中打开
导航至:
```
http://localhost:8501
```
## 技术栈
- Python 3
- Scikit-learn
- NLTK
- Pandas
- NumPy
- Streamlit
## 机器学习工作流
1. 数据清理与 NLP 预处理
2. TF-IDF 特征提取
3. 自定义欺诈特征工程
4. Random Forest 模型训练
5. 使用 Streamlit 进行实时预测
## 未来改进
- 基于 Deep Learning 的 NLP 模型(BERT/LSTM)
- 用于实时诈骗检测的浏览器扩展
- 与在线招聘门户网站集成
- 云部署支持
## 数据集
使用的数据集:**EMSCAD Fake Job Postings Dataset**
标签:Apex, Kubernetes, 反欺诈, 数据科学, 机器学习, 资源验证, 逆向工具, 随机森林