Instructions to use pathcosmos/frankenstallm with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use pathcosmos/frankenstallm with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="pathcosmos/frankenstallm")# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("pathcosmos/frankenstallm") model = AutoModelForCausalLM.from_pretrained("pathcosmos/frankenstallm", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use pathcosmos/frankenstallm with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf pathcosmos/frankenstallm:Q4_K_M # Run inference directly in the terminal: llama cli -hf pathcosmos/frankenstallm:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf pathcosmos/frankenstallm:Q4_K_M # Run inference directly in the terminal: llama cli -hf pathcosmos/frankenstallm:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf pathcosmos/frankenstallm:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf pathcosmos/frankenstallm:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf pathcosmos/frankenstallm:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf pathcosmos/frankenstallm:Q4_K_M
Use Docker
docker model run hf.co/pathcosmos/frankenstallm:Q4_K_M
- LM Studio
- Jan
- vLLM
How to use pathcosmos/frankenstallm with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "pathcosmos/frankenstallm" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "pathcosmos/frankenstallm", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/pathcosmos/frankenstallm:Q4_K_M
- SGLang
How to use pathcosmos/frankenstallm with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "pathcosmos/frankenstallm" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "pathcosmos/frankenstallm", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "pathcosmos/frankenstallm" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "pathcosmos/frankenstallm", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Ollama
How to use pathcosmos/frankenstallm with Ollama:
ollama run hf.co/pathcosmos/frankenstallm:Q4_K_M
- Unsloth Desktop
- Docker Model Runner
How to use pathcosmos/frankenstallm with Docker Model Runner:
docker model run hf.co/pathcosmos/frankenstallm:Q4_K_M
- Lemonade
How to use pathcosmos/frankenstallm with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull pathcosmos/frankenstallm:Q4_K_M
Run and chat with the model
lemonade run user.frankenstallm-Q4_K_M
List all available models
lemonade list
- Atomic Chat
Download reports/2026-03-05_3B_BASE_EVALUATION_REPORT.md from pathcosmos/frankenstallm: direct link, hf CLI and curl.
- Browser
- Download file 7.87 kB
-
https://huggingface.co/pathcosmos/frankenstallm/resolve/main/reports/2026-03-05_3B_BASE_EVALUATION_REPORT.md
- Command line
-
hf download hf://pathcosmos/frankenstallm/reports/2026-03-05_3B_BASE_EVALUATION_REPORT.md
-
curl -L -o 2026-03-05_3B_BASE_EVALUATION_REPORT.md https://huggingface.co/pathcosmos/frankenstallm/resolve/main/reports/2026-03-05_3B_BASE_EVALUATION_REPORT.md
FRANKENSTALLM 3B Base โ ์ข ํฉ ํ๊ฐ ๋ณด๊ณ ์
์์ฑ์ผ: 2026-03-05 ์์ฑ์: FRANKENSTALLM ํ ๋ฒ์ : 1.0
์์ฝ
FRANKENSTALLM 3B ๋ชจ๋ธ์ ์ฌ์ ํ์ต(pretraining)์ด ์๋ฃ๋์๋ค. ๋ณธ ๋ณด๊ณ ์๋ checkpoint-0057000 ๊ธฐ์ค์ ์ ์ฒด ํ๊ฐ ๊ฒฐ๊ณผ๋ฅผ ์ข ํฉํ๊ณ , ๋ค์ ๋จ๊ณ(SFT) ์งํ ์ฌ๋ถ์ ๋ํ ํ๋จ์ ๋ด๋๋ค.
1. ํ์ต ์์ฝ
| ํญ๋ชฉ | ๋ด์ฉ |
|---|---|
| ๋ชจ๋ธ ์ด๋ฆ | FRANKENSTALLM 3B |
| ํ๋ผ๋ฏธํฐ ์ | 3,015M (์ฝ 3B) |
| ์ฒดํฌํฌ์ธํธ | checkpoint-0057000 |
| ํ์ต ์คํ | 57,000 steps (์๋ฃ) |
| ์ต์ข ํ์ต loss | 1.466 |
| ํ์ต ์๊ฐ | ์ฝ 63์๊ฐ |
| ํ์ต ํ ํฐ | 41.12B tokens |
| ์ธํ๋ผ | 8ร NVIDIA B200, DDP, MXFP8 (TransformerEngine) |
| ์๋ฃ ์ํ | ๋ฌด์ฌ๊ณ ์๋ฃ |
2. Perplexity (PPL) ํ๊ฐ
๊ฒ์ฆ์ ๋ณ ๊ฒฐ๊ณผ
| ๊ฒ์ฆ์ | PPL | BPT (Bits Per Token) |
|---|---|---|
| 3b_val (ํตํฉ ๊ฒ์ฆ์ ) | 5.709 | 2.513 |
| korean_c4 | 5.717 | 2.515 |
| korean_namuwiki | 25.881 | 4.694 |
| korean_wiki | 11.836 | 3.565 |
ํด์
- ํตํฉ PPL 5.709: 3B ๋ชจ๋ธ๋ก์ ํฉ๋ฆฌ์ ์ธ ๋ฒ์. C4 Korean ๊ธฐ๋ฐ์ด ํ์ต ๋ฐ์ดํฐ์ ์ฃผ๋ฅ์ด๋ฏ๋ก C4 ๊ฒ์ฆ์ PPL์ด ๊ฐ์ฅ ๋ฎ๋ค.
- ๋๋ฌด์ํค PPL 25.9: ๋์ ํธ. ๋๋ฌด์ํค ํน์ ์ ๋ฌธ์ฒด(์๋ธ์ปฌ์ฒ ์ฉ์ด, ์ํค ๋งํฌ์ ์์ฌ, ์ ์กฐ์ด)๊ฐ ํ์ต ๋ถํฌ์ ์ด๊ธ๋๋ ๊ฒ์ผ๋ก ์ถ์ . ๋ฐ์ดํฐ ํ์ง ์ ๊ฒ ํ์.
- ์ํค๋ฐฑ๊ณผ PPL 11.8: ๋๋ฌด์ํค๋ณด๋ค ๋ฎ์ง๋ง C4๋ณด๋ค ๋์. ์ํค ๋ฌธ์ฒด(์ ํํ๋ ๋ฐฑ๊ณผ์ฌ์ ์ฒด)์ ํ๋ จ ๋ฐ์ดํฐ ๋ถํฌ ์ฐจ์ด.
- BPT(Bits Per Token): 2.513 bpt๋ ์ ๋ณด ์ด๋ก ์ ์ผ๋ก ์ํธํ ์์ค.
3. ๋ฒค์น๋งํฌ ํ๊ฐ
lm-evaluation-harness ๊ฒฐ๊ณผ
| ๋ฒค์น๋งํฌ | 3B Base | ๋๋ค ๊ธฐ์ค | ๋น๊ณ |
|---|---|---|---|
| belebele_kor_Hang | 0.2189 | 0.25 | 4์ง์ ๋ค ๋ ํด ์ดํด |
| global_mmlu_full_ko | 0.2339 | 0.25 | 4์ง์ ๋ค ์ง์ ํ๊ฐ |
ํด์
- Base model์์ ๋๋ค ์์ค์ ์ ์: ์ง์ ํ๋(SFT) ์์ด base model์ด 4์ง์ ๋ค ํ์์ ๋ฒค์น๋งํฌ๋ฅผ ํ๋ ค๋ฉด, ์ง๋ฌธ-๋ต๋ณ ํ์ ์์ฒด๋ฅผ ์ดํดํด์ผ ํ๋ค. Base model์ ์ด ํ์์ ์ต์ ํ๋์ด ์์ง ์๋ค.
- 0.219 vs 0.25 (๋๋ค): ๋๋ค๋ณด๋ค ์ํญ ๋ฎ์ง๋ง, ์ด๋ base model์์ ํํ ๊ด์ฐฐ๋๋ ํ์์ด๋ค (์ ํ์ง ํ ํฐ ๊ฐ ํ๋ฅ ๋ถํฌ๊ฐ ํ์คํฌ์ ๋ง๊ฒ ์กฐ์ ๋์ง ์์).
- SFT ํ ๊ธฐ๋: Llama, Mistral ๋ฑ ์ ์ฌ ๊ท๋ชจ ๋ชจ๋ธ๋ค๋ SFT ์ดํ ๋ฒค์น๋งํฌ๊ฐ ๊ธ๊ฒฉํ ํฅ์๋๋ค. ํ์ฌ ์์น๋ก SFT ํจ๊ณผ๋ฅผ ํ๋จํ ์ ์๋ค.
4. ์์ฑ ํ์ง ํ๊ฐ
์จ๋๋ณ 3-gram ๋ฐ๋ณต๋ฅ ๋ฐ EOS ์ข ๋ฃ์จ
| ์จ๋ (Temperature) | 3-gram ๋ฐ๋ณต๋ฅ | EOS ์ข ๋ฃ์จ | ํ๊ฐ |
|---|---|---|---|
| 0.0 (greedy) | 71.1% | 0% | ๋ฐ๋ณต ์ฌ๊ฐ (base ํน์ฑ) |
| 0.7 | 40.5% | 0% | ๊ฐ์ ๋๋ ์ฌ์ ํ ๋์ |
| 1.0 | 9.3% | 0% | ๊ฐ์ฅ ๋ฎ์ ๋ฐ๋ณต๋ฅ |
no_repeat_ngram_size ํจ๊ณผ
| ํ๋ผ๋ฏธํฐ | ๊ฒฐ๊ณผ |
|---|---|
| ๋ฏธ์ ์ฉ (๊ธฐ๋ณธ) | ์จ๋๋ณ 71.1~9.3% |
no_repeat_ngram_size=3 |
0% (๋ชจ๋ ์จ๋ ๊ตฌ๊ฐ) |
EOS ์ข ๋ฃ์จ 0% ํด์
- Base model์ instruction-following ํ์ต์ด ์์ผ๋ฏ๋ก, ์์ฐ์ค๋ฌ์ด ๋ํ ์ข ๋ฃ(EOS) ์์ ์ ํ์ตํ์ง ์์๋ค.
- EOS ์ข ๋ฃ์จ 0%๋ base model์์ ์ ์์ ์ธ ํ์์ด๋ค.
- SFT ์ดํ EOS ์ข ๋ฃ์จ์ด ํฌ๊ฒ ํฅ์๋ ๊ฒ์ผ๋ก ์์๋๋ค.
๊ถ์ฅ ์ถ๋ก ํ๋ผ๋ฏธํฐ
SFT ์ด์ base model ์ฉ๋๋ก ์คํ ์ ๊ถ์ฅ ์ค์ :
generation_config = {
"temperature": 0.9,
"top_p": 0.9,
"no_repeat_ngram_size": 3,
"repetition_penalty": 1.1,
"max_new_tokens": 512,
}
5. 1B vs 3B ๋น๊ต
์ฃผ์ ์งํ ๋น๊ตํ
| ์งํ | 1B (SFT ํ) | 3B Base | ํ์ | ๋น๊ณ |
|---|---|---|---|---|
| Training loss | 1.904 | 1.466 | โ ๊ฐ์ | 3B๊ฐ ๋ ์ ํ์ต๋จ |
| PPL (C4 Korean) | 5.67 | 5.72 | โ ๋๋ฑ | ๋ฐ์ดํฐ ๊ตฌ์ฑ ์ฐจ์ด ๋ฐ์ |
| 3-gram ๋ฐ๋ณต๋ฅ (greedy) | 30.7% | 71.1% | โ ๏ธ ๋น๊ต ์ฃผ์ | SFT vs Base ์ฐจ์ด |
| EOS ์ข ๋ฃ์จ | 60% | 0% | โ | Base model ์ ์ |
| kobest_copa | 0.646 (SFT) | N/A | โ | lm-eval ๋ฏธ์ง์ ํ์ |
| belebele_kor | N/A | 0.219 | โ | Base โ random |
๋น๊ต ์ ์ฃผ์์ฌํญ
- ๋ฐ๋ณต๋ฅ ๋น๊ต๋ ์ง์ ๋น๊ต ๋ถ๊ฐ: 1B(30.7%)๋ SFT ์ดํ ์ธก์ ๊ฐ์ด๊ณ , 3B(71.1%)๋ base model ์ธก์ ๊ฐ์ด๋ค. SFT ์ 1B์ greedy ๋ฐ๋ณต๋ฅ ์ ํจ์ฌ ๋์์ ๊ฒ์ด๋ค.
- PPL ๋๋ฑ์ ์๋ฏธ ์๋ค: 1B๋ C4 Korean ์์ฃผ(8.5B tok), 3B๋ ๋ค์ํ ๋๋ฉ์ธ ํผํฉ(41.12B tok)์ผ๋ก ํ์ตํ๋ค. ๋ ๋ค์ํ ๋ถํฌ๋ฅผ ํ์ตํ๋ฉด์๋ C4 PPL์ด ๋๋ฑํ๋ค๋ ๊ฒ์ 3B๊ฐ ๋ ๋์ ์ง์์ ์ต๋ํ์์ ์์ฌํ๋ค.
- Training loss 1.466 vs 1.904: ๋์ผ ํ ํฌ๋์ด์ ๊ธฐ์ค์ด๋ฏ๋ก ์ง์ ๋น๊ต ๊ฐ๋ฅ. ๋ช ํํ ๊ฐ์ .
6. SFT ์งํ ์ฌ๋ถ ํ๋จ
ํ๋จ ๊ธฐ์ค ๋ฐ ๊ฒฐ๊ณผ
| ๊ธฐ์ค | ์๊ณ๊ฐ | ์ค์ธก๊ฐ | ํ์ |
|---|---|---|---|
| PPL (C4 Korean) | < 5.0 | 5.72 | โ ๏ธ ๋ฏธ๋ฌ |
| Training loss | โ | 1.466 | โ 1B(1.904) ๋๋น ๋ช ํ ๊ฐ์ |
| ๋ชจ๋ธ ๊ตฌ์กฐ ๋ฌธ์ ์งํ | ์์ด์ผ ํจ | ์์ | โ ์ด์ ์์ |
| ํ์ต ์์ ์ฑ | loss ๋ฐ์ฐ ์์ด ์๋ฃ | ๋ฌด์ฌ๊ณ ์๋ฃ | โ ์์ |
ํ๋จ ๊ทผ๊ฑฐ
PPL 5.72 โ ์๊ณ๊ฐ ๋ฏธ๋ฌ์ด์ง๋ง ์ํธ
- ๊ธฐ์ค(< 5.0)์๋ ๋ฏธ๋ฌ์ด์ง๋ง, 3B ๋ชจ๋ธ์ด 1B๋ณด๋ค ํจ์ฌ ๋ค์ํ ๋ฐ์ดํฐ(40B tok vs 8.5B tok)๋ก ํ์ตํ๊ณ , ๋๋ฉ์ธ ๋ถํฌ ์ฐจ์ด๋ฅผ ๊ฐ์ํ๋ฉด ํฉ๋ฆฌ์ ์ธ ๋ฒ์๋ค.
- ๋จ์ C4 ํนํ ํ์ต์ด์๋ค๋ฉด ๋ ๋ฎ์ PPL์ด ๋์์ ๊ฒ์ด๋, ๋ค์ํ ๋๋ฉ์ธ ์ปค๋ฒ๋ฆฌ์ง๊ฐ ๋ ๊ฐ์น ์๋ค.
Training loss 1.466 โ ๊ฑด๊ฐํ ํ์ต ์๋ฃ ์๊ทธ๋
- 1B(1.904) ๋๋น ๋ช ํํ ๊ฐ์ . ๋ชจ๋ธ์ด ๋ฐ์ดํฐ๋ฅผ ์ ํ์ตํ์์ ์๋ฏธํ๋ค.
- loss๊ฐ 1.5 ์ดํ์ด๋ฉด SFT๊ฐ ์๋ฏธ ์๋ ์ง์ ๊ธฐ๋ฐ ์์์ ์์ํ๋ค๋ ๊ฒฝํ์ ๊ธฐ์ค์ ์ถฉ์กฑํ๋ค.
Greedy ๋ฐ๋ณต๋ฅ 71% โ base model์์ ์ผ๋ฐ์
- Base model์ greedy ๋ฐ๋ณต์ SFT๊ฐ ํด๊ฒฐํ๋ ์์ญ์ด๋ค. SFT ํ ํฌ๊ฒ ๊ฐ์ ๋ ๊ฒ์ผ๋ก ์์.
no_repeat_ngram_size=3์ผ๋ก ์ฆ์ 0%๊น์ง ๋ฎ์ถ ์ ์์์ด ํ์ธ๋๋ค.
belebele/MMLU โ ๋๋ค โ base model ํน์ฑ
- SFT ์ดํ ํฅ์ ๊ธฐ๋. ๋ชจ๋ธ ์์ฒด์ ๋ฌธ์ ๊ฐ ์๋๋ผ ํ์ ์ ์ ๋ฌธ์ .
์ต์ข ๊ฒฐ๋ก
SFT ์งํ ๊ฒฐ์ : โ
- Loss 1.466์ ๊ฑด๊ฐํ ์ฌ์ ํ์ต ์๋ฃ ์๊ทธ๋์ด๋ค.
- PPL์ ๋ฐ์ดํฐ ๊ตฌ์ฑ ์ฐจ์ด๋ก ์ง์ ๋น๊ต๊ฐ ์ด๋ ต์ง๋ง ํฉ๋ฆฌ์ ์ธ ๋ฒ์๋ค.
- ๋ฐ๋ณต๋ฅ ๊ณผ ๋ฒค์น๋งํฌ๋ SFT๊ฐ ํด๊ฒฐํ ์์ญ์ด๋ค.
- ๋ชจ๋ธ ๊ตฌ์กฐ ๋ฌธ์ (๋ฐ์ฐ, ์ด์ loss, gradient ํญ๋ฐ)์ ์งํ๊ฐ ์๋ค.
7. ๋จ์ ๋ฆฌ์คํฌ ๋ฐ ๊ถ๊ณ ์ฌํญ
๋ฆฌ์คํฌ
| ๋ฆฌ์คํฌ | ์ฌ๊ฐ๋ | ๋์ ๋ฐฉ์ |
|---|---|---|
| C4 PPL์ด 1B์ ๋น์ท | ์ค๊ฐ | Extended pretrain (80-100B tok) ๊ณ ๋ ค |
| ๋๋ฌด์ํค PPL 25.9 ๋์ | ์ค๊ฐ | SFT ๋ฐ์ดํฐ ํ์ง ์ ๊ฒ, ๋๋ฌด์ํค ๋น์ค ์ฌ์กฐ์ |
| SFT ํ EOS ์ข ๋ฃ์จ | ๋ฎ์ | SFT ๋ฐ์ดํฐ์ EOS ๋ง์ปค ํ์ธ |
๊ถ๊ณ ์ฌํญ
- ์ฆ์: SFT ํ์ดํ๋ผ์ธ ์์ (๋ฐ์ดํฐ ์ค๋น ์๋ฃ, ์คํฌ๋ฆฝํธ ์ค๋น๋จ)
- SFT ์ค: ๋ฐ๋ณต๋ฅ ๋ฐ EOS ์ข ๋ฃ์จ ๋ชจ๋ํฐ๋ง
- SFT ์๋ฃ ํ: kobest_copa, kobest_hellaswag ์ ์ฒด ํ๊ฐ
- ์ค๊ธฐ: Extended pretrain์ ํตํ PPL ๊ฐ์ ๊ฒํ (80-100B tok ๋ชฉํ)
8. ์ฒดํฌํฌ์ธํธ ์ ๋ณด
| ํญ๋ชฉ | ๊ฐ |
|---|---|
| ์ฒดํฌํฌ์ธํธ ๊ฒฝ๋ก | checkpoints/checkpoint-0057000/ |
| ๋ชจ๋ธ ํ์ผ | model.pt |
| ์ตํฐ๋ง์ด์ ์ํ | optimizer.pt |
| ์ค์ผ์ค๋ฌ ์ํ | scheduler.pt |
| ํ์ต ๋ฉํ๋ฐ์ดํฐ | training_state.json |
๋ณด๊ณ ์ ์์ฑ: 2026-03-05 ๋ค์ ๋จ๊ณ: Phase 2 SFT ์งํ