[shardformer] upgrade transformers to 4.39.3 (#5815)

* [shardformer]upgrade transformers for gpt2/gptj/whisper (#5807) * [shardformer] fix modeling of gpt2 and gptj * [shardformer] fix whisper modeling * [misc] update requirements --------- Co-authored-by: ver217 <lhx0217@gmail.com> * [shardformer]upgrade transformers for mistral (#5808) * upgrade transformers for mistral * fix * fix * [shardformer]upgrade transformers for llama (#5809) * update transformers fix * fix * fix * [inference] upgrade transformers (#5810) * update transformers fix * fix * fix * fix * fix * [gemini] update transformers for gemini (#5814) --------- Co-authored-by: ver217 <lhx0217@gmail.com>
2025-09-27 20:46:00 +00:00 · 2024-06-14 10:59:33 +08:00
parent 3bcbba9262
commit 2ddf624a86
12 changed files with 257 additions and 240 deletions
--- a/colossalai/shardformer/policies/mistral.py
+++ b/colossalai/shardformer/policies/mistral.py
@@ -42,11 +42,13 @@ class MistralPolicy(Policy):
            MistralDecoderLayer,
            MistralFlashAttention2,
            MistralModel,
+            MistralSdpaAttention,
        )

        ATTN_IMPLEMENTATION = {
            "eager": MistralAttention,
            "flash_attention_2": MistralFlashAttention2,
+            "sdpa": MistralSdpaAttention,
        }

        policy = {}