panli ef3df73166 refactor: 三层架构重构 + 配置文件 + 项目目录整理
清洗管线重构为严格三层架构:
- tango_analyser.py(底层:单词分析)
- task_processor.py(中层:文件 I/O、桶管理)
- workflow.py(顶层:状态机、任务推进)
- 移除旧的 batch_processor.py

新增配置文件系统:
- config.py:TOML 配置,相对路径相对配置文件目录解析
- 查找优先级 --config > cwd > 项目根 > ~ > 默认值
- count=None 语义为处理到文件末尾

项目目录整理:
- 根脚本归档到 scripts/analysis 与 scripts/legacy
- 文档归档到 docs/{design,history,analysis}
- 临时报告移到 reports/(已 gitignore)

文档质量:
- 新增 .markdownlint.json 与 scripts/mdlint.cmd
- 修复全部 14 个 md 文件的 markdownlint 警告

测试:74 passed(8 cleaner + 31 workflow + 6 tango + 15 validator + 14 config)
2026-08-19 19:40:02 +08:00

64 lines
1.6 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# Legacy Scripts已废弃脚本
这个目录存放已被新架构取代的旧脚本,保留仅供参考。
## 文件清单
### `pipeline.py` (443 行)
**状态**:已废弃,被 `jclean` 完全取代
**原功能**
- 半自动流水线:处理 `xinbiaori_tobe.txt` 的分割 + 拼音校正
- 输入格式:`汉字词:假名:``汉字词:假名:`(第三段拼音为空)
- 输出:分类到 `auto_done.txt` / `review_pinyin.txt` / `review_split.txt` / `review_verb.txt` / `review_special.txt`
- 使用 jamdict 词典进行假名分割
**被取代原因**
- 功能与现在的 `jclean` 工作流完全重复
- 没有任务管理、状态机、配置文件等现代特性
- 输出文件固定,不支持批次隔离
**现代替代**
```bash
jclean create task1 --source xinbiaori_tobe.txt
jclean run task1
```
---
### `apply_corrections.py` (77 行)
**状态**:已废弃,历史修正已完成
**原功能**
- 批量应用人工确认后的修正到 `xinbiaori.txt`
- 硬编码了几十条修正规则(拼音手误、假名错误等)
- 修正格式:`(说明, 旧行, 新行)`
**被取代原因**
- 一次性脚本,历史数据修正已完成
- 新的工作流中,修正直接在 review 桶文件中编辑,重跑即可
**现代替代**
```bash
# 人工修正 review_pinyin.txt 后重跑
jclean run task1 --bucket pinyin
```
---
## 使用建议
⚠️ **不要再使用这些脚本**
这些脚本已经不维护,仅作为历史参考保留。所有功能都已迁移到 `jclean` 工具。
如果需要查看旧的处理逻辑,可以阅读代码,但不要运行。