* packing optimziation with cache to reduce D2H copy * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * cache per device to avoid race condition for multi-gpu * [pre-commit.ci] auto fixes from pre-commit.com hooks for more information, see https://pre-commit.ci * add cache freeing up func --------- Co-authored-by: ruixiangw <ruixiangw@nvidia.com> Co-authored-by: pre-commit-ci[bot] <66853113+pre-commit-ci[bot]@users.noreply.github.com> Co-authored-by: ruixiang <wangruixiang07@outlook.com> |
||
|---|---|---|
| .. | ||
| __init__.py | ||
| attention_dispatch.py | ||
| hf_hub.py | ||
| packing.py | ||