Skip to content
Draft
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
9 changes: 9 additions & 0 deletions CHANGELOG.md
Original file line number Diff line number Diff line change
@@ -1,5 +1,14 @@
# Change log

## [v1.3.2(WIP)+fix/wikitext-hf-dataset-id] 2026-08-18

### Bug Fix

- Fix WikiText dataset loading in clean environments by using the canonical
`Salesforce/wikitext` dataset ID for perplexity evaluation and LoRA SFT examples.

## [v1.3.2] 2026-08-dd

## [v1.3.1] 2026-08-06

### Bug Fix
Expand Down
2 changes: 1 addition & 1 deletion docs/user-guide/examples.md
Original file line number Diff line number Diff line change
Expand Up @@ -578,7 +578,7 @@ model_config = ModelConfig(
gptq = GPTQ(wbits=4, groupsize=128)

post_process = PostProcessLoraSFT(
dataset_name="wikitext",
dataset_name="Salesforce/wikitext",
dataset_config_name="wikitext-2-raw-v1",
train_split="train",
text_column="text",
Expand Down
8 changes: 4 additions & 4 deletions docs/user-guide/post-process.md
Original file line number Diff line number Diff line change
Expand Up @@ -354,7 +354,7 @@ model_config = ModelConfig(
gptq = GPTQ(wbits=4, groupsize=128)

post_process = PostProcessLoraSFT(
dataset_name="wikitext",
dataset_name="Salesforce/wikitext",
dataset_config_name="wikitext-2-raw-v1",
train_split="train",
text_column="text",
Expand Down Expand Up @@ -512,7 +512,7 @@ model, tokenizer = load_quantized_model_pt(

```python
PostProcessLoraSFT(
dataset_name="wikitext",
dataset_name="Salesforce/wikitext",
dataset_config_name="wikitext-2-raw-v1",
train_split="train",
text_column="text",
Expand Down Expand Up @@ -560,7 +560,7 @@ Teacher distillation aligns the quantized model's output distribution with a ful

```python
post_process = PostProcessLoraSFT(
dataset_name="wikitext",
dataset_name="Salesforce/wikitext",
dataset_config_name="wikitext-2-raw-v1",
train_split="train",
text_column="text",
Expand Down Expand Up @@ -591,7 +591,7 @@ Intermediate block alignment adds a loss term that aligns hidden states at selec

```python
post_process = PostProcessLoraSFT(
dataset_name="wikitext",
dataset_name="Salesforce/wikitext",
dataset_config_name="wikitext-2-raw-v1",
train_split="train",
text_column="text",
Expand Down
2 changes: 1 addition & 1 deletion example/post_process/example_lora_sft.py
Original file line number Diff line number Diff line change
Expand Up @@ -66,7 +66,7 @@ def generate_text(model, tokenizer, prompt, device, max_new_tokens=64):
gptq = GPTQ(wbits=4, groupsize=128)

post_process = PostProcessLoraSFT(
dataset_name="wikitext",
dataset_name="Salesforce/wikitext",
dataset_config_name="wikitext-2-raw-v1",
train_split="train",
text_column="text",
Expand Down
2 changes: 1 addition & 1 deletion onecomp/__version__.py
Original file line number Diff line number Diff line change
Expand Up @@ -6,4 +6,4 @@

"""

__version__ = "1.3.1"
__version__ = "1.3.2"
4 changes: 2 additions & 2 deletions onecomp/runner.py
Original file line number Diff line number Diff line change
Expand Up @@ -1260,7 +1260,7 @@ def calculate_perplexity(
original_model=False,
dequantized_model=False,
quantized_model=True,
dataset_name="wikitext",
dataset_name="Salesforce/wikitext",
dataset_config="wikitext-2-raw-v1",
split="test",
max_samples=None,
Expand Down Expand Up @@ -1342,7 +1342,7 @@ def benchmark_perplexity(
original_model=True,
dequantized_model=False,
quantized_model=True,
dataset_name="wikitext",
dataset_name="Salesforce/wikitext",
dataset_config="wikitext-2-raw-v1",
split="test",
max_samples=None,
Expand Down
4 changes: 2 additions & 2 deletions onecomp/utils/perplexity.py
Original file line number Diff line number Diff line change
Expand Up @@ -41,7 +41,7 @@ def calculate_perplexity(
model=None,
tokenizer=None,
model_config=None,
dataset_name="wikitext",
dataset_name="Salesforce/wikitext",
dataset_config="wikitext-2-raw-v1",
split="test",
max_samples=None,
Expand All @@ -53,7 +53,7 @@ def calculate_perplexity(
Based on https://huggingface.co/docs/transformers/perplexity

Args:
dataset_name (str): Dataset name (e.g. "wikitext", "allenai/c4").
dataset_name (str): Dataset name (e.g. "Salesforce/wikitext", "allenai/c4").
dataset_config (str): Dataset configuration.
- For WikiText: "wikitext-2-raw-v1"
- For C4: "en/c4-train.00001-of-01024.json.gz" (treated as data_files)
Expand Down