diff --git a/kda/training/data.py b/kda/training/data.py index 3d8f1fe..e23e3dc 100644 --- a/kda/training/data.py +++ b/kda/training/data.py @@ -75,6 +75,8 @@ def load_tokenizer(source: str) -> Tokenizer: from transformers import AutoTokenizer tok = AutoTokenizer.from_pretrained(source, trust_remote_code=True) + # 只借词表分词, 语料随后按 seq_len 切块, 不受原模型 4096 上限约束 + tok.model_max_length = 10**9 return HuggingFaceTokenizer(tok)