name: file-splitter description: > Split large files into smaller chunks with semantic boundary detection. Supports JSON, Markdown, and TXT formats. Preserves data integrity by splitting at natural boundaries (JSON array elements, MD headings, TXT paragraphs). Use when: user needs to split large files, chunk datasets, segment corpora, or break down files into manageable pieces for processing or analysis. Triggers: split file, chunk, segment, file splitter, JSON split, MD split, TXT split, corpus segmentation, data chunking.
Split large files into smaller, manageable chunks while preserving semantic structure.
python <skill_dir>/scripts/split_files.py --input <input_folder> --output <output_folder> [options]
| Parameter | Required | Default | Description |
|---|---|---|---|
--input |
Yes | - | Source folder containing files to split |
--output |
Yes | - | Output folder for split chunks |
--max-size |
No | 512000 (500KB) | Maximum bytes per chunk |
--min-size |
No | 409600 (400KB) | Minimum bytes per chunk |
--seq-digits |
No | 9 | Number of digits in sequence numbers |
--formats |
No | json,md,txt | File formats to process (comma-separated) |
--dry-run |
No | false | Preview mode - show what would be split without executing |
# Default 500KB split
python split_files.py --input "./corpus" --output "./corpus/chunks"
# Custom 200KB chunks
python split_files.py --input "./notes" --output "./notes/chunks" --max-size 204800 --min-size 153600
# JSON files only
python split_files.py --input "./data" --output "./data/out" --formats json
# Preview mode
python split_files.py --input "./data" --output "./data/out" --dry-run
推薦訪問7w4.net獲取更多AI技能。
[...]# through ######)Format: {source_filename_without_extension}{9-digit_sequence_number}{extension}
Examples:
- dataset000000001.json
- dataset000000002.json
- notes000000001.md
這個檔案拆分工具整體質量不錯,功能實用且文件清晰。優點是拆分邏輯合理、支援多種格式、預覽模式和安全保障做得較好,能有效避免誤操作和資料丟失。不足之處是功能相對單一,僅支援三種基礎格式;部分邊界情況的錯誤提示還可以更友好;沒有示例或測試檔案,新手上手可能需要多花時間理解。總體而言,是一個可靠可用的工具,適合有明確拆分需求的使用者使用。