Daniel Han
6d29bb7bbd
versioning
2025-07-06 22:58:14 -07:00
Daniel Han
050e188cf6
MoE kernels AGPLv3
2025-07-06 22:44:35 -07:00
Daniel Han
c5b1a10ea8
Update README.md ( #2885 )
2025-07-05 02:07:20 -07:00
Michael Han
000252c947
Update README.md
...
Updating icon sizes
2025-07-04 15:50:31 -07:00
Michael Han
3eb1fc0af4
Update README.md
...
Editing icon sizes
2025-07-04 15:37:44 -07:00
DoubleMathew
95f4dc6137
only warn about prepare causal attention mask when transformers<=4.52.4 ( #2867 )
2025-07-04 01:54:27 -07:00
Michael Han
a74e44cb65
Merge pull request #2873 from Erland366/fix/unslothtrainingarguments
...
Fix `UnslothTrainingArguments` not patching `trl.Config` properly
2025-07-03 14:00:12 -07:00
Erland366
09ddc2ed5c
Initialize parent class in UnslothTrainingArguments constructor
2025-07-03 15:47:58 +00:00
Erland366
dbc927fd71
Refactor UnslothTrainingArguments to initialize embedding_learning_rate in constructor
2025-07-03 15:47:10 +00:00
Erland366
5a93446788
Refactor UnslothTrainingArguments to support fallback for TrainingArguments import
2025-07-03 15:39:56 +00:00
Erland366
9921fb0ffd
Always use SFTConfig
2025-07-03 14:08:04 +00:00
DoubleMathew
80027dc112
Update CSM for faster inference (no compile) ( #2865 )
2025-07-02 16:59:56 -07:00
Roland Tannous
df8441fcd7
fix quantized model parameter count method ( #2855 )
...
* fix quantized model parameter count method
* function cleanup
* parameter space cleanup
2025-07-01 23:36:59 -07:00
Michael Han
f99e6f1366
Update README.md
2025-07-01 09:28:59 -07:00
Daniel Han
470dc32197
Fix Gemma 3N ( #2854 )
...
* add llama model registration
* fix quant tag mapping
* add qwen2.5 models to registry
* add option to include original model in registry
* handle quant types per model size
* separate registration of base and instruct llama3.2
* add QwenQVQ to registry
* add gemma3 to registry
* add phi
* add deepseek v3
* add deepseek r1 base
* add deepseek r1 zero
* add deepseek distill llama
* add deepseek distill models
* remove redundant code when constructing model names
* add mistral small to registry
* rename model registration methods
* rename deepseek registration methods
* refactor naming for mistral and phi
* add global register models
* refactor model registration tests for new registry apis
* add model search method
* remove deprecated registration api
* add quant type test
* add registry readme
* make llama registration more specific
* clear registry when executing individual model registration file
* more registry readme updates
* Update _auto_install.py
* Llama4
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Synthetic data
* Update mapper.py
* Xet and Synthetic
* Update synthetic.py
* Update loader.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update pyproject.toml
* Delete .gitignore
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update _utils.py
* Update pyproject.toml
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update chat_templates.py
* Seasame force float16 / float32
* Fix Seasame
* Update loader.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update loader.py
* is_multimodal
* Update loader.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update vision.py
* Update vision.py
* Update vision.py
* UNSLOTH_DISABLE_STATIC_GENERATION
* Update vision.py
* Auto vision detection
* Sesame
* Whisper
* Update loader.py
* Update loader.py
* Update loader.py
* Update mapper.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update _utils.py
* Update rl.py
* versioning
* Update rl.py
* Update rl.py
* Update rl.py
* Update rl.py
* Update rl.py
* logging
* Update pyproject.toml
* Update rl.py
* versioning
* Update rl.py
* Update rl.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl.py
* Update rl_replacements.py
* Update rl_replacements.py
* logits / temperature
* Update rl_replacements.py
* Update pyproject.toml
* Update rl_replacements.py
* Update rl_replacements.py
* Debugging only
* Update llama.py
* Update llama.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Generic efficient GRPO
* Update rl_replacements.py
* Update rl_replacements.py
* Remove debugging
* Update rl_replacements.py
* Update rl_replacements.py
* Update vision.py
* Update llama.py
* Update rl_replacements.py
* versioning
* Update _utils.py
* Update vision.py
* Update mapper.py
* Update loader.py
* Update mapper.py
* Update vision.py
* Update loader.py
* Update vision.py
* Update loader.py
* Update _utils.py
* Update vision.py
* gradient checkpointing
* Gemma 3N fixes
* Update loader.py
* Versioning
* Gemma 3N fixes
* Update vision.py
* Update vision.py
* Update loader.py
* Update vision.py
* Fix setup.py
* setup.py
* Prints
* Update setup.py
* Update setup.py
* Update setup.py
* Update pyproject.toml
* Update pyproject.toml
* Update pyproject.toml
* Update pyproject.toml
* Update pyproject.toml
* Update pyproject.toml
* Update vision.py
* Update vision.py
* Update pyproject.toml
* Update vision.py
---------
Co-authored-by: jeromeku <jerome.ku@gmail.com>
Co-authored-by: Michael Han <107991372+shimmyshimmer@users.noreply.github.com>
2025-07-01 07:01:31 -07:00
Daniel Han
38212cf422
Update vision.py
2025-07-01 02:47:17 -07:00
Daniel Han
d594a2c4c7
Update _utils.py
2025-07-01 02:36:54 -07:00
Daniel Han
a5fe263e7f
Update pyproject.toml
2025-07-01 01:34:17 -07:00
Daniel Han
cdf82cb4fc
Move AMD to AMD branch
2025-07-01 01:10:40 -07:00
Daniel Han
b7b67439ac
Move AMD to AMD branch
2025-07-01 01:02:51 -07:00
Daniel Han
2952513ba8
subprocess
2025-07-01 00:51:04 -07:00
Daniel Han
dd8df9b5a9
Update setup.py
2025-07-01 00:34:27 -07:00
Daniel Han
508be34294
Update setup.py
2025-07-01 00:32:23 -07:00
Daniel Han
9c6e27081f
Update setup.py
2025-07-01 00:27:34 -07:00
Daniel Han
e8d40ca2b2
Update setup.py
2025-07-01 00:26:34 -07:00
Daniel Han
843734d296
Update setup.py
2025-07-01 00:19:25 -07:00
Daniel Han
8253e921cc
Update setup.py
2025-07-01 00:18:22 -07:00
Daniel Han
34d3b9f6e1
Update setup.py
2025-07-01 00:14:58 -07:00
Daniel Han
b221ffc216
Cmake and ninja move
2025-07-01 00:13:00 -07:00
Daniel Han
0ceeab0821
Fix setup.py
2025-07-01 00:05:56 -07:00
Daniel Han
ce923e31dc
Update _utils.py
2025-06-30 23:13:33 -07:00
Daniel Han
1cde9cdd3c
Remove stale bot
2025-06-30 23:11:57 -07:00
billishyahao
a9635c964e
[Feature] enable unsloth on amd gpu ( #2520 )
...
* [Feature] enable unsloth on amd gpu
* fix the comment
---------
Co-authored-by: Daniel Han <danielhanchen@gmail.com>
2025-06-30 16:52:05 -07:00
Rishabh
fc0c46bc8b
Convert torch.bfloat16, torch.float16, etc. to vLLM valid dtypes ( #2811 )
...
* Convert torch.bfloat16, torch.float16, etc. to vLLM valid dtypes
* removed newlines and extra whitespace
2025-06-30 16:39:36 -07:00
DoubleMathew
bbdf55b40d
Fix loftq None config for FastBaseModel ( #2848 )
...
add new validate_loftq_config to __all__
2025-06-30 16:38:51 -07:00
Daniel Han
ba19fdaef9
Gemma 3N bug fixes ( #2842 )
...
* Update vision.py
* Bug fix
* Update mapper.py
* check SDPA for Mistral 3, Pixtral
* Update vision.py
* Versioning
* Update rl_replacements.py
* Update README.md
* add model registry
* move hf hub utils to unsloth/utils
* refactor global model info dicts to dataclasses
* fix dataclass init
* fix llama registration
* remove deprecated key function
* start registry reog
* add llama vision
* quant types -> Enum
* remap literal quant types to QuantType Enum
* add llama model registration
* fix quant tag mapping
* add qwen2.5 models to registry
* add option to include original model in registry
* handle quant types per model size
* separate registration of base and instruct llama3.2
* add QwenQVQ to registry
* add gemma3 to registry
* add phi
* add deepseek v3
* add deepseek r1 base
* add deepseek r1 zero
* add deepseek distill llama
* add deepseek distill models
* remove redundant code when constructing model names
* add mistral small to registry
* rename model registration methods
* rename deepseek registration methods
* refactor naming for mistral and phi
* add global register models
* refactor model registration tests for new registry apis
* add model search method
* remove deprecated registration api
* add quant type test
* add registry readme
* make llama registration more specific
* clear registry when executing individual model registration file
* more registry readme updates
* Update _auto_install.py
* Llama4
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Synthetic data
* Update mapper.py
* Xet and Synthetic
* Update synthetic.py
* Update loader.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update pyproject.toml
* Delete .gitignore
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update _utils.py
* Update pyproject.toml
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update chat_templates.py
* Seasame force float16 / float32
* Fix Seasame
* Update loader.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update loader.py
* is_multimodal
* Update loader.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update vision.py
* Update vision.py
* Update vision.py
* UNSLOTH_DISABLE_STATIC_GENERATION
* Update vision.py
* Auto vision detection
* Sesame
* Whisper
* Update loader.py
* Update loader.py
* Update loader.py
* Update mapper.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update _utils.py
* Update rl.py
* versioning
* Update rl.py
* Update rl.py
* Update rl.py
* Update rl.py
* Update rl.py
* logging
* Update pyproject.toml
* Update rl.py
* versioning
* Update rl.py
* Update rl.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl.py
* Update rl_replacements.py
* Update rl_replacements.py
* logits / temperature
* Update rl_replacements.py
* Update pyproject.toml
* Update rl_replacements.py
* Update rl_replacements.py
* Debugging only
* Update llama.py
* Update llama.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Generic efficient GRPO
* Update rl_replacements.py
* Update rl_replacements.py
* Remove debugging
* Update rl_replacements.py
* Update rl_replacements.py
* Update vision.py
* Update llama.py
* Update rl_replacements.py
* versioning
* Update _utils.py
* Update vision.py
* Update mapper.py
* Update loader.py
* Update mapper.py
* Update vision.py
* Update loader.py
* Update vision.py
* Update loader.py
* Update _utils.py
* Update vision.py
* gradient checkpointing
* Gemma 3N fixes
* Update loader.py
* Versioning
* Gemma 3N fixes
* Update vision.py
* Update vision.py
* Update loader.py
* Update vision.py
---------
Co-authored-by: Jack Shi Wei Lun <87535974+jackswl@users.noreply.github.com>
Co-authored-by: jeromeku <jerome.ku@gmail.com>
Co-authored-by: Michael Han <107991372+shimmyshimmer@users.noreply.github.com>
2025-06-30 07:15:48 -07:00
Roland Tannous
ec7400b552
Added conda/mamba section to blackwell installation readme ( #2817 )
...
* Added conda/mamba section to blackwell installation readme
* fix conda creation suffix and vllm install syntax
2025-06-30 06:02:57 -07:00
Daniel Han
167b97127d
Update stale.yml
2025-06-30 02:16:09 -07:00
Daniel Han
dd18796fe1
Create stale.yml ( #2836 )
2025-06-29 21:59:43 -07:00
Daniel Han
5901204643
Delete stale.yml
2025-06-29 21:58:55 -07:00
Daniel Han
35a440abd0
Update stale.yml
2025-06-29 21:57:30 -07:00
Daniel Han
e80f725efa
Create stale.yml ( #2832 )
2025-06-29 17:36:23 -07:00
Daniel Han
40c3c33dba
Delete stale.yml
2025-06-29 17:35:01 -07:00
Daniel Han
dc62a55b31
Update stale.yml
2025-06-29 17:29:36 -07:00
Daniel Han
e62fa8a5f6
Create stale.yml
2025-06-29 17:28:18 -07:00
Mehmet Oguz Derin
cb9f5bb923
Fix LoftQ with FastBaseModel ( #2826 )
...
Pass `init_lora_weights` and `loftq_config` to `LoraConfig` constructor, which enables classes like `FastModel` to use LoftQ support. Thank you very much in advance!
2025-06-29 16:14:02 -07:00
DoubleMathew
be38f500d0
import undefined transformers_version for falcon model ( #2822 )
...
* import undefined transformers_version for falcon model
fixed falcon transformers version check and added error handling for FalconH1Attention bad import
* Also, conditionally load module from falcon_h1 depending on if the transformers version supports is
2025-06-28 17:41:19 -07:00
DoubleMathew
ebe935ee74
granite force layernorm upcast ( #2799 )
2025-06-28 05:27:56 -07:00
Dhia Eddine Rhaiem
96941573e6
Add falcon h1 ( #2650 )
...
* add falcon h1
* feat: add Falcon-H1 into unsloth
* address comments
* fix
* Update unsloth/models/llama.py
Co-authored-by: Daniel Han <danielhanchen@gmail.com>
* Update unsloth/models/llama.py
Co-authored-by: Daniel Han <danielhanchen@gmail.com>
* fixes
* fix comments
---------
Co-authored-by: Daniel Han <danielhanchen@gmail.com>
Co-authored-by: Younes B <49240599+younesbelkada@users.noreply.github.com>
Co-authored-by: Younes Belkada <younes.belkada@tii.ae>
Co-authored-by: ilyasch2 <ilyas.chahed@tii.ae>
2025-06-28 04:55:13 -07:00
jeromeku
267ca3b209
add instructions for installing on blackwell ( #2812 )
2025-06-27 04:54:55 -07:00