Standalone tree split from LLMRL/projects/kda. Includes Triton dt_bias backward fix, train_k3 --preset 0.5b, SFT, Docker runtime, and tests.
30 lines
857 B
YAML
30 lines
857 B
YAML
# GPU train / eval against the image in Dockerfile.
|
|
# docker compose run --rm train python train_k3.py --preset toy
|
|
# docker compose run --rm train swanlab ping
|
|
# docker compose run --rm train python -m kda.training.eval_mt --ckpt ...
|
|
#
|
|
# Secrets and corpora stay on the host.
|
|
|
|
services:
|
|
train:
|
|
build: .
|
|
image: kda:latest
|
|
gpus: all
|
|
ipc: host
|
|
shm_size: "2gb"
|
|
working_dir: /workspace/kda
|
|
environment:
|
|
SWANLAB_API_KEY: ${SWANLAB_API_KEY:-}
|
|
HF_HOME: /cache/huggingface
|
|
HUGGINGFACE_HUB_CACHE: /cache/huggingface
|
|
volumes:
|
|
- ./ckpts:/workspace/kda/ckpts
|
|
- ./data:/workspace/kda/data
|
|
- ${PRETRAIN_DATA:-./data/pretrain}:/data/pretrain:ro
|
|
- ${EVAL_DATA:-./data/eval}:/data/eval:ro
|
|
- ${SFT_DATA:-./data/sft}:/data/sft:ro
|
|
- hf-cache:/cache/huggingface
|
|
|
|
volumes:
|
|
hf-cache:
|