# Analysis Scripts(分析工具)
这个目录存放数据分析脚本,用于**清理完成后**对权威库进行统计分析和质量验证。
## 状态
🚧 **待集成** — 这些脚本是独立工具,未来将集成到 jclean 作为子命令。
---
## 文件清单
### `analyze_phonetics.py` (194 行)
**功能**:日语汉字发音规律分析
**用途**:
- 从词表中提取「汉字 → 中文拼音 → 日语假名」对应样本
- 统计中文读音与日语音读之间的系统性规律
- 分析声母/韵母对应关系、长音/拨音特征
**输入**:词表文件(格式:`汉字|分段:假名|分段:拼音|分段`)
**输出**:统计报告(控制台)
- 中文声母 → 日语音读映射频率
- 韵母对应规律
- 长音、拨音等特征统计
**使用**:
```bash
python scripts/analysis/analyze_phonetics.py data/db/vocabulary.txt
```
**未来集成**:
```bash
# 计划作为 jclean 子命令
jclean analyze phonetics --input data/db/vocabulary.txt
```
---
### `validate_data.py` (234 行)
**功能**:词表数据质量校验
**用途**:
- 拼音校验:用 pypinyin 检查每个汉字拼音是否在合法读音集合内(考虑多音字)
- 日语读音校验:
- 整词级:用 jamdict 真词典查整词,验证假名是否为该词已知读音
- 单字级:用 kanjidic 的音读/训读,检查每个汉字的假名是否合理
- 结构校验:三段是否齐全、汉字数/假名数/拼音数是否对齐
**输入**:词表文件
**输出**:`validation_report.txt`(UTF-8,避免控制台乱码)
- 拼音错误列表
- 假名不匹配列表
- 结构异常列表
**使用**:
```bash
python scripts/analysis/validate_data.py data/db/vocabulary.txt data/db/skipped.txt
```
**未来集成**:
```bash
# 计划作为 jclean 子命令
jclean validate --input data/db/vocabulary.txt --output report.txt
```
---
## 依赖
这些脚本依赖额外的分析库(未包含在 jclean 核心依赖中):
```bash
# 拼音分析
pip install pypinyin
# 日语词典(validate_data.py)
pip install jamdict
```
**数据库路径**(`validate_data.py` 中硬编码):
- 本地副本:`C:\Users\panli\jamdict_local.db`
- 网络路径:`\\192.168.3.200\work\workspace\python\japanese\src\pl_japanese\jamdict.db\jamdict.db`
---
## 集成计划
未来这些工具将整合进 jclean:
```bash
jclean analyze phonetics # 发音规律分析
jclean validate # 数据质量校验
jclean stats # 统计信息(词条数、覆盖率等)
```
在集成时需要:
1. 将核心逻辑提取为模块(避免重复代码)
2. 统一输入/输出格式(支持配置文件中的路径)
3. 可选依赖处理(pypinyin/jamdict 作为可选分析功能)
4. 添加对应测试
---
## 当前使用
在集成之前,可以直接运行这些脚本:
```bash
# 分析发音规律
cd \\192.168.3.200\work\workspace\python\japanese
python scripts/analysis/analyze_phonetics.py data/db/vocabulary.txt
# 校验数据质量
python scripts/analysis/validate_data.py data/db/vocabulary.txt
cat validation_report.txt
```