Daniel Han
eaeba82aee
Update README.md ( #2885 )
2025-07-05 02:07:20 -07:00
Michael Han
d672f03d0b
Update README.md
...
Updating icon sizes
2025-07-04 15:50:31 -07:00
Michael Han
61a220ffef
Update README.md
...
Editing icon sizes
2025-07-04 15:37:44 -07:00
DoubleMathew
cc29dc5c35
only warn about prepare causal attention mask when transformers<=4.52.4 ( #2867 )
2025-07-04 01:54:27 -07:00
Michael Han
51a70235a4
Merge pull request #2873 from Erland366/fix/unslothtrainingarguments
...
Fix `UnslothTrainingArguments` not patching `trl.Config` properly
2025-07-03 14:00:12 -07:00
Erland366
3bad31a16f
Initialize parent class in UnslothTrainingArguments constructor
2025-07-03 15:47:58 +00:00
Erland366
fcb0b94f24
Refactor UnslothTrainingArguments to initialize embedding_learning_rate in constructor
2025-07-03 15:47:10 +00:00
Erland366
18c73a42fa
Refactor UnslothTrainingArguments to support fallback for TrainingArguments import
2025-07-03 15:39:56 +00:00
Erland366
a2fa52f28c
Always use SFTConfig
2025-07-03 14:08:04 +00:00
DoubleMathew
b347ec5ae4
Update CSM for faster inference (no compile) ( #2865 )
2025-07-02 16:59:56 -07:00
Roland Tannous
3691534111
fix quantized model parameter count method ( #2855 )
...
* fix quantized model parameter count method
* function cleanup
* parameter space cleanup
2025-07-01 23:36:59 -07:00
Michael Han
968fd27265
Update README.md
2025-07-01 09:28:59 -07:00
Daniel Han
644eb5c66d
Fix Gemma 3N ( #2854 )
...
* add llama model registration
* fix quant tag mapping
* add qwen2.5 models to registry
* add option to include original model in registry
* handle quant types per model size
* separate registration of base and instruct llama3.2
* add QwenQVQ to registry
* add gemma3 to registry
* add phi
* add deepseek v3
* add deepseek r1 base
* add deepseek r1 zero
* add deepseek distill llama
* add deepseek distill models
* remove redundant code when constructing model names
* add mistral small to registry
* rename model registration methods
* rename deepseek registration methods
* refactor naming for mistral and phi
* add global register models
* refactor model registration tests for new registry apis
* add model search method
* remove deprecated registration api
* add quant type test
* add registry readme
* make llama registration more specific
* clear registry when executing individual model registration file
* more registry readme updates
* Update _auto_install.py
* Llama4
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Synthetic data
* Update mapper.py
* Xet and Synthetic
* Update synthetic.py
* Update loader.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update pyproject.toml
* Delete .gitignore
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update _utils.py
* Update pyproject.toml
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update chat_templates.py
* Seasame force float16 / float32
* Fix Seasame
* Update loader.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update loader.py
* is_multimodal
* Update loader.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update vision.py
* Update vision.py
* Update vision.py
* UNSLOTH_DISABLE_STATIC_GENERATION
* Update vision.py
* Auto vision detection
* Sesame
* Whisper
* Update loader.py
* Update loader.py
* Update loader.py
* Update mapper.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update _utils.py
* Update rl.py
* versioning
* Update rl.py
* Update rl.py
* Update rl.py
* Update rl.py
* Update rl.py
* logging
* Update pyproject.toml
* Update rl.py
* versioning
* Update rl.py
* Update rl.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl.py
* Update rl_replacements.py
* Update rl_replacements.py
* logits / temperature
* Update rl_replacements.py
* Update pyproject.toml
* Update rl_replacements.py
* Update rl_replacements.py
* Debugging only
* Update llama.py
* Update llama.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Generic efficient GRPO
* Update rl_replacements.py
* Update rl_replacements.py
* Remove debugging
* Update rl_replacements.py
* Update rl_replacements.py
* Update vision.py
* Update llama.py
* Update rl_replacements.py
* versioning
* Update _utils.py
* Update vision.py
* Update mapper.py
* Update loader.py
* Update mapper.py
* Update vision.py
* Update loader.py
* Update vision.py
* Update loader.py
* Update _utils.py
* Update vision.py
* gradient checkpointing
* Gemma 3N fixes
* Update loader.py
* Versioning
* Gemma 3N fixes
* Update vision.py
* Update vision.py
* Update loader.py
* Update vision.py
* Fix setup.py
* setup.py
* Prints
* Update setup.py
* Update setup.py
* Update setup.py
* Update pyproject.toml
* Update pyproject.toml
* Update pyproject.toml
* Update pyproject.toml
* Update pyproject.toml
* Update pyproject.toml
* Update vision.py
* Update vision.py
* Update pyproject.toml
* Update vision.py
---------
Co-authored-by: jeromeku <jerome.ku@gmail.com>
Co-authored-by: Michael Han <107991372+shimmyshimmer@users.noreply.github.com>
2025-07-01 07:01:31 -07:00
Daniel Han
d78bf49045
Update vision.py
2025-07-01 02:47:17 -07:00
Daniel Han
08ee15f83b
Update _utils.py
2025-07-01 02:36:54 -07:00
Daniel Han
6f4bde25db
Update pyproject.toml
2025-07-01 01:34:17 -07:00
Daniel Han
6f27839955
Move AMD to AMD branch
2025-07-01 01:10:40 -07:00
Daniel Han
eef2515749
Move AMD to AMD branch
2025-07-01 01:02:51 -07:00
Daniel Han
2ac58e30e8
subprocess
2025-07-01 00:51:04 -07:00
Daniel Han
e73487a4a6
Update setup.py
2025-07-01 00:34:27 -07:00
Daniel Han
a6b9a8fce3
Update setup.py
2025-07-01 00:32:23 -07:00
Daniel Han
ce8815f1c7
Update setup.py
2025-07-01 00:27:34 -07:00
Daniel Han
5958944ddd
Update setup.py
2025-07-01 00:26:34 -07:00
Daniel Han
90c5b9a380
Update setup.py
2025-07-01 00:19:25 -07:00
Daniel Han
51b06266e2
Update setup.py
2025-07-01 00:18:22 -07:00
Daniel Han
7cc17da547
Update setup.py
2025-07-01 00:14:58 -07:00
Daniel Han
a5e37ac1a2
Cmake and ninja move
2025-07-01 00:13:00 -07:00
Daniel Han
3c1c8e5b95
Fix setup.py
2025-07-01 00:05:56 -07:00
Daniel Han
08f5c90428
Update _utils.py
2025-06-30 23:13:33 -07:00
Daniel Han
e29cbd8d83
Remove stale bot
2025-06-30 23:11:57 -07:00
billishyahao
06ca5c273b
[Feature] enable unsloth on amd gpu ( #2520 )
...
* [Feature] enable unsloth on amd gpu
* fix the comment
---------
Co-authored-by: Daniel Han <danielhanchen@gmail.com>
2025-06-30 16:52:05 -07:00
Rishabh
a15e77fc63
Convert torch.bfloat16, torch.float16, etc. to vLLM valid dtypes ( #2811 )
...
* Convert torch.bfloat16, torch.float16, etc. to vLLM valid dtypes
* removed newlines and extra whitespace
2025-06-30 16:39:36 -07:00
DoubleMathew
8e6ec3bf04
Fix loftq None config for FastBaseModel ( #2848 )
...
add new validate_loftq_config to __all__
2025-06-30 16:38:51 -07:00
Daniel Han
9aa13e4e64
Gemma 3N bug fixes ( #2842 )
...
* Update vision.py
* Bug fix
* Update mapper.py
* check SDPA for Mistral 3, Pixtral
* Update vision.py
* Versioning
* Update rl_replacements.py
* Update README.md
* add model registry
* move hf hub utils to unsloth/utils
* refactor global model info dicts to dataclasses
* fix dataclass init
* fix llama registration
* remove deprecated key function
* start registry reog
* add llama vision
* quant types -> Enum
* remap literal quant types to QuantType Enum
* add llama model registration
* fix quant tag mapping
* add qwen2.5 models to registry
* add option to include original model in registry
* handle quant types per model size
* separate registration of base and instruct llama3.2
* add QwenQVQ to registry
* add gemma3 to registry
* add phi
* add deepseek v3
* add deepseek r1 base
* add deepseek r1 zero
* add deepseek distill llama
* add deepseek distill models
* remove redundant code when constructing model names
* add mistral small to registry
* rename model registration methods
* rename deepseek registration methods
* refactor naming for mistral and phi
* add global register models
* refactor model registration tests for new registry apis
* add model search method
* remove deprecated registration api
* add quant type test
* add registry readme
* make llama registration more specific
* clear registry when executing individual model registration file
* more registry readme updates
* Update _auto_install.py
* Llama4
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Synthetic data
* Update mapper.py
* Xet and Synthetic
* Update synthetic.py
* Update loader.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update pyproject.toml
* Delete .gitignore
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update _utils.py
* Update pyproject.toml
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update synthetic.py
* Update chat_templates.py
* Seasame force float16 / float32
* Fix Seasame
* Update loader.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update loader.py
* is_multimodal
* Update loader.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update vision.py
* Update vision.py
* Update vision.py
* UNSLOTH_DISABLE_STATIC_GENERATION
* Update vision.py
* Auto vision detection
* Sesame
* Whisper
* Update loader.py
* Update loader.py
* Update loader.py
* Update mapper.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update vision.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update loader.py
* Update _utils.py
* Update rl.py
* versioning
* Update rl.py
* Update rl.py
* Update rl.py
* Update rl.py
* Update rl.py
* logging
* Update pyproject.toml
* Update rl.py
* versioning
* Update rl.py
* Update rl.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl.py
* Update rl_replacements.py
* Update rl_replacements.py
* logits / temperature
* Update rl_replacements.py
* Update pyproject.toml
* Update rl_replacements.py
* Update rl_replacements.py
* Debugging only
* Update llama.py
* Update llama.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Update rl_replacements.py
* Generic efficient GRPO
* Update rl_replacements.py
* Update rl_replacements.py
* Remove debugging
* Update rl_replacements.py
* Update rl_replacements.py
* Update vision.py
* Update llama.py
* Update rl_replacements.py
* versioning
* Update _utils.py
* Update vision.py
* Update mapper.py
* Update loader.py
* Update mapper.py
* Update vision.py
* Update loader.py
* Update vision.py
* Update loader.py
* Update _utils.py
* Update vision.py
* gradient checkpointing
* Gemma 3N fixes
* Update loader.py
* Versioning
* Gemma 3N fixes
* Update vision.py
* Update vision.py
* Update loader.py
* Update vision.py
---------
Co-authored-by: Jack Shi Wei Lun <87535974+jackswl@users.noreply.github.com>
Co-authored-by: jeromeku <jerome.ku@gmail.com>
Co-authored-by: Michael Han <107991372+shimmyshimmer@users.noreply.github.com>
2025-06-30 07:15:48 -07:00
Roland Tannous
3d78d44e76
Added conda/mamba section to blackwell installation readme ( #2817 )
...
* Added conda/mamba section to blackwell installation readme
* fix conda creation suffix and vllm install syntax
2025-06-30 06:02:57 -07:00
Daniel Han
bc77032d90
Update stale.yml
2025-06-30 02:16:09 -07:00
Daniel Han
651c8d4498
Create stale.yml ( #2836 )
2025-06-29 21:59:43 -07:00
Daniel Han
748b192177
Delete stale.yml
2025-06-29 21:58:55 -07:00
Daniel Han
3e3fdecaf1
Update stale.yml
2025-06-29 21:57:30 -07:00
Daniel Han
19abdf89e7
Create stale.yml ( #2832 )
2025-06-29 17:36:23 -07:00
Daniel Han
dd764704de
Delete stale.yml
2025-06-29 17:35:01 -07:00
Daniel Han
33203d1bac
Update stale.yml
2025-06-29 17:29:36 -07:00
Daniel Han
a63a031547
Create stale.yml
2025-06-29 17:28:18 -07:00
Mehmet Oguz Derin
58a808f171
Fix LoftQ with FastBaseModel ( #2826 )
...
Pass `init_lora_weights` and `loftq_config` to `LoraConfig` constructor, which enables classes like `FastModel` to use LoftQ support. Thank you very much in advance!
2025-06-29 16:14:02 -07:00
DoubleMathew
5d460ba39e
import undefined transformers_version for falcon model ( #2822 )
...
* import undefined transformers_version for falcon model
fixed falcon transformers version check and added error handling for FalconH1Attention bad import
* Also, conditionally load module from falcon_h1 depending on if the transformers version supports is
2025-06-28 17:41:19 -07:00
DoubleMathew
6e72d688f5
granite force layernorm upcast ( #2799 )
2025-06-28 05:27:56 -07:00
Dhia Eddine Rhaiem
a8f3d69266
Add falcon h1 ( #2650 )
...
* add falcon h1
* feat: add Falcon-H1 into unsloth
* address comments
* fix
* Update unsloth/models/llama.py
Co-authored-by: Daniel Han <danielhanchen@gmail.com>
* Update unsloth/models/llama.py
Co-authored-by: Daniel Han <danielhanchen@gmail.com>
* fixes
* fix comments
---------
Co-authored-by: Daniel Han <danielhanchen@gmail.com>
Co-authored-by: Younes B <49240599+younesbelkada@users.noreply.github.com>
Co-authored-by: Younes Belkada <younes.belkada@tii.ae>
Co-authored-by: ilyasch2 <ilyas.chahed@tii.ae>
2025-06-28 04:55:13 -07:00
jeromeku
b02be210dc
add instructions for installing on blackwell ( #2812 )
2025-06-27 04:54:55 -07:00
Daniel Han
bfa6a3678e
Update loader.py
2025-06-26 12:03:29 -07:00
Daniel Han
1b94959160
Update _utils.py
2025-06-26 11:31:17 -07:00