清洗管线重构为严格三层架构:
- tango_analyser.py(底层:单词分析)
- task_processor.py(中层:文件 I/O、桶管理)
- workflow.py(顶层:状态机、任务推进)
- 移除旧的 batch_processor.py
新增配置文件系统:
- config.py:TOML 配置,相对路径相对配置文件目录解析
- 查找优先级 --config > cwd > 项目根 > ~ > 默认值
- count=None 语义为处理到文件末尾
项目目录整理:
- 根脚本归档到 scripts/analysis 与 scripts/legacy
- 文档归档到 docs/{design,history,analysis}
- 临时报告移到 reports/(已 gitignore)
文档质量:
- 新增 .markdownlint.json 与 scripts/mdlint.cmd
- 修复全部 14 个 md 文件的 markdownlint 警告
测试:74 passed(8 cleaner + 31 workflow + 6 tango + 15 validator + 14 config)
64 lines
1.6 KiB
Markdown
64 lines
1.6 KiB
Markdown
# Legacy Scripts(已废弃脚本)
|
||
|
||
这个目录存放已被新架构取代的旧脚本,保留仅供参考。
|
||
|
||
## 文件清单
|
||
|
||
### `pipeline.py` (443 行)
|
||
|
||
**状态**:已废弃,被 `jclean` 完全取代
|
||
|
||
**原功能**:
|
||
|
||
- 半自动流水线:处理 `xinbiaori_tobe.txt` 的分割 + 拼音校正
|
||
- 输入格式:`汉字词:假名:` 或 `汉字词:假名:`(第三段拼音为空)
|
||
- 输出:分类到 `auto_done.txt` / `review_pinyin.txt` / `review_split.txt` / `review_verb.txt` / `review_special.txt`
|
||
- 使用 jamdict 词典进行假名分割
|
||
|
||
**被取代原因**:
|
||
|
||
- 功能与现在的 `jclean` 工作流完全重复
|
||
- 没有任务管理、状态机、配置文件等现代特性
|
||
- 输出文件固定,不支持批次隔离
|
||
|
||
**现代替代**:
|
||
|
||
```bash
|
||
jclean create task1 --source xinbiaori_tobe.txt
|
||
jclean run task1
|
||
```
|
||
|
||
---
|
||
|
||
### `apply_corrections.py` (77 行)
|
||
|
||
**状态**:已废弃,历史修正已完成
|
||
|
||
**原功能**:
|
||
|
||
- 批量应用人工确认后的修正到 `xinbiaori.txt`
|
||
- 硬编码了几十条修正规则(拼音手误、假名错误等)
|
||
- 修正格式:`(说明, 旧行, 新行)`
|
||
|
||
**被取代原因**:
|
||
|
||
- 一次性脚本,历史数据修正已完成
|
||
- 新的工作流中,修正直接在 review 桶文件中编辑,重跑即可
|
||
|
||
**现代替代**:
|
||
|
||
```bash
|
||
# 人工修正 review_pinyin.txt 后重跑
|
||
jclean run task1 --bucket pinyin
|
||
```
|
||
|
||
---
|
||
|
||
## 使用建议
|
||
|
||
⚠️ **不要再使用这些脚本**
|
||
|
||
这些脚本已经不维护,仅作为历史参考保留。所有功能都已迁移到 `jclean` 工具。
|
||
|
||
如果需要查看旧的处理逻辑,可以阅读代码,但不要运行。
|