panli ef3df73166 refactor: 三层架构重构 + 配置文件 + 项目目录整理
清洗管线重构为严格三层架构:
- tango_analyser.py(底层:单词分析)
- task_processor.py(中层:文件 I/O、桶管理)
- workflow.py(顶层:状态机、任务推进)
- 移除旧的 batch_processor.py

新增配置文件系统:
- config.py:TOML 配置,相对路径相对配置文件目录解析
- 查找优先级 --config > cwd > 项目根 > ~ > 默认值
- count=None 语义为处理到文件末尾

项目目录整理:
- 根脚本归档到 scripts/analysis 与 scripts/legacy
- 文档归档到 docs/{design,history,analysis}
- 临时报告移到 reports/(已 gitignore)

文档质量:
- 新增 .markdownlint.json 与 scripts/mdlint.cmd
- 修复全部 14 个 md 文件的 markdownlint 警告

测试:74 passed(8 cleaner + 31 workflow + 6 tango + 15 validator + 14 config)
2026-08-19 19:40:02 +08:00
..

Legacy Scripts已废弃脚本

这个目录存放已被新架构取代的旧脚本,保留仅供参考。

文件清单

pipeline.py (443 行)

状态:已废弃,被 jclean 完全取代

原功能

  • 半自动流水线:处理 xinbiaori_tobe.txt 的分割 + 拼音校正
  • 输入格式:汉字词:假名:汉字词:假名:(第三段拼音为空)
  • 输出:分类到 auto_done.txt / review_pinyin.txt / review_split.txt / review_verb.txt / review_special.txt
  • 使用 jamdict 词典进行假名分割

被取代原因

  • 功能与现在的 jclean 工作流完全重复
  • 没有任务管理、状态机、配置文件等现代特性
  • 输出文件固定,不支持批次隔离

现代替代

jclean create task1 --source xinbiaori_tobe.txt
jclean run task1

apply_corrections.py (77 行)

状态:已废弃,历史修正已完成

原功能

  • 批量应用人工确认后的修正到 xinbiaori.txt
  • 硬编码了几十条修正规则(拼音手误、假名错误等)
  • 修正格式:(说明, 旧行, 新行)

被取代原因

  • 一次性脚本,历史数据修正已完成
  • 新的工作流中,修正直接在 review 桶文件中编辑,重跑即可

现代替代

# 人工修正 review_pinyin.txt 后重跑
jclean run task1 --bucket pinyin

使用建议

⚠️ 不要再使用这些脚本

这些脚本已经不维护,仅作为历史参考保留。所有功能都已迁移到 jclean 工具。

如果需要查看旧的处理逻辑,可以阅读代码,但不要运行。