[MOE] add unitest for MOE experts layout, gradient handler and kernel (#469)

2025-08-31 16:40:41 +00:00 · 2022-03-21 13:35:04 +08:00
parent 1559c0df41
commit 7544347145
13 changed files with 263 additions and 499 deletions
--- a/tests/test_moe/test_grad_handler.py
+++ b/tests/test_moe/test_grad_handler.py
@@ -0,0 +1,72 @@
+from functools import partial
+import pytest
+import torch
+import torch.nn as nn
+import torch.multiprocessing as mp
+import torch.distributed as dist
+import colossalai
+from colossalai.utils import free_port, get_current_device
+from colossalai.nn.layer.moe import Top1Router, UniformNoiseGenerator, MoeLayer, Experts
+from colossalai.core import MOE_CONTEXT
+from colossalai.utils.moe import sync_moe_model_param
+from colossalai.engine.gradient_handler import MoeGradientHandler
+from colossalai.testing import assert_equal_in_group
+
+BATCH_SIZE = 4
+DIM = 16
+CONFIG = dict()
+
+
+def run_test(rank, world_size, port):
+    colossalai.launch(config=CONFIG, rank=rank, world_size=world_size, host='localhost', port=port, backend='nccl')
+    expert_module = nn.Linear
+    expert_factor = dict(in_features=DIM, out_features=DIM, device=get_current_device())
+
+    MOE_CONTEXT.setup(42)    # MOE initialization
+    noisy_func = UniformNoiseGenerator()
+    router = Top1Router(noisy_func=noisy_func)
+    num_experts_list = [1, 2, 4]
+    layer_list = []
+    for num_experts in num_experts_list:
+        exp = Experts(expert_module, num_experts, **expert_factor)
+        moe_layer = MoeLayer(DIM, num_experts, router, exp)
+        layer_list.append(moe_layer)
+
+    model = nn.Sequential(*layer_list)
+    model = model.to(get_current_device())
+    sync_moe_model_param(model)
+
+    dist_dict = MOE_CONTEXT.information
+    assert_equal_in_group(layer_list[0].experts.experts[0].weight.data, dist_dict[1].dp_group)
+    assert_equal_in_group(layer_list[1].experts.experts[0].weight.data, dist_dict[2].dp_group)
+    # MoE model synchronization passed
+
+    grad_handler = MoeGradientHandler(model, 0)
+
+    rank = dist.get_rank()
+    torch.cuda.manual_seed(78 + rank)
+    data = torch.randn(BATCH_SIZE, DIM, device=get_current_device())
+    grad = torch.randn_like(data)
+
+    MOE_CONTEXT.reset_loss()
+    outputs = model(data)
+    outputs.backward(grad)
+    grad_handler.handle_gradient()
+
+    assert_equal_in_group(layer_list[0].experts.experts[0].weight.grad, dist_dict[1].dp_group)
+    assert_equal_in_group(layer_list[0].experts.experts[0].bias.grad, dist_dict[1].dp_group)
+
+    assert_equal_in_group(layer_list[1].experts.experts[0].weight.grad, dist_dict[2].dp_group)
+    assert_equal_in_group(layer_list[1].experts.experts[0].bias.grad, dist_dict[2].dp_group)
+    # MoE grad handler test passed
+
+
+@pytest.mark.dist
+def test_grad_handler():
+    world_size = 4
+    run_func = partial(run_test, world_size=world_size, port=free_port())
+    mp.spawn(run_func, nprocs=world_size)
+
+
+if __name__ == '__main__':
+    test_grad_handler()
--- a/tests/test_moe/test_kernel.py
+++ b/tests/test_moe/test_kernel.py
@@ -7,57 +7,64 @@ import colossalai
 from colossalai.context import ParallelMode
 from colossalai.core import global_context as gpc
 from colossalai.utils import free_port, get_current_device
-from colossalai.nn.layer.moe import Top2Router, MoeLayer, Experts
-from colossalai.context.random import moe_set_seed
-from colossalai.global_variables import moe_env
+from colossalai.nn.layer.moe import Top1Router, Top2Router, MoeLayer, Experts
+from colossalai.core import MOE_CONTEXT

-BATCH_SIZE = 32
+BATCH_SIZE = 16
 NUM_EXPERTS = 4
-CONFIG = dict(parallel=dict(moe=dict(size=4)))
+CONFIG = dict()


-def check_equal(A, B, atol=1e-06):
-    assert torch.allclose(A, B, rtol=0, atol=atol) is True
+def check_equal(tensor_a, tensor_b, atol=1e-06):
+    assert torch.allclose(tensor_a, tensor_b, rtol=0, atol=atol) is True


-def run_routing(rank, world_size, port, rs=2, hidden_size=128, data_type=torch.float32):
-    colossalai.launch(config=CONFIG, rank=rank, world_size=world_size, host='localhost', port=port, backend='nccl')
-    moe_set_seed(42)
-
+def run_routing(rank, world_size, port, rs=2, hidden_size=128, data_type=torch.float32, router=Top2Router):
+    # Here we do not need TF32, since it brings absolute error on results
    torch.backends.cuda.matmul.allow_tf32 = False
+
+    colossalai.launch(config=CONFIG, rank=rank, world_size=world_size, host='localhost', port=port, backend='nccl')
    local_rank = gpc.get_local_rank(ParallelMode.GLOBAL)
-    torch.manual_seed(rs + local_rank)
-    moe_env.reset_loss()
+
+    MOE_CONTEXT.setup(42)    # MOE environment initialization
+    MOE_CONTEXT.reset_loss()
+    torch.manual_seed(rs + local_rank)    # set each process has different random seed
+
+    # get randomized data
    tokens = torch.randn(BATCH_SIZE, hidden_size, dtype=data_type, device=get_current_device(), requires_grad=True)

-    router = Top2Router(1)
-    expert = Experts(nn.Identity, 4)
-    layer = MoeLayer(hidden_size, NUM_EXPERTS, router, expert)
+    expert_module = nn.Linear
+    expert_factor = dict(in_features=hidden_size, out_features=hidden_size, device=get_current_device())
+    expert = Experts(expert_module, NUM_EXPERTS, **expert_factor)
+    layer = MoeLayer(hidden_size, NUM_EXPERTS, router(capacity_factor_train=1.0), expert)
    if data_type == torch.float16:
        layer = layer.half()
-    layer.cuda_mode = False

+    # use matrix multiplication instead of COL_MOE_KERNL in MOE dispatch and combine
+    layer.use_kernel = False
    old_out = layer(tokens)
-
    ech = old_out.shape
    grad = torch.randn(ech, device=get_current_device())
-    old_out.backward(grad)
+    old_out.backward(grad)    # get gradient

+    # save all results
    o_tk_grad = tokens.grad.data.clone()
    o_gt_grad = layer.gate.weight.grad.data.clone()

+    # reset all gradients
    tokens.grad.zero_()
    layer.gate.weight.grad.zero_()

-    layer.cuda_mode = True
-    new_out = layer(tokens)
+    layer.use_kernel = True
+    new_out = layer(tokens)    # get ouputs through colossal kernel

    if data_type == torch.float32:
        check_equal(old_out, new_out)
    else:
        check_equal(old_out, new_out, 1e-2)
+    # forward function passed

-    new_out.backward(grad)
+    new_out.backward(grad)    # get new type gradient
    n_tk_grad = tokens.grad.data.clone()
    n_gt_grad = layer.gate.weight.grad.data.clone()

@@ -65,28 +72,31 @@ def run_routing(rank, world_size, port, rs=2, hidden_size=128, data_type=torch.f
        check_equal(o_tk_grad, n_tk_grad)
    else:
        check_equal(o_tk_grad, o_tk_grad, 1e-2)
+    # tokens gradient is correct

    if data_type == torch.float32:
        check_equal(o_gt_grad, n_gt_grad, 5e-05)
    else:
        check_equal(o_gt_grad, n_gt_grad, 2e-01)
+    # bias gradient is correct


-@pytest.mark.skip(reason="MoE refactoring has not finished yet")
@pytest.mark.dist
@pytest.mark.parametrize("rs", [131])
@pytest.mark.parametrize("hidden_size", [32, 144])
@pytest.mark.parametrize("data_type", [torch.float32, torch.float16])
-def test_moe_top2(rs, hidden_size, data_type):
+@pytest.mark.parametrize("router", [Top1Router, Top2Router])
+def test_moe_kernel(rs, hidden_size, data_type, router):
    world_size = 4
    run_func = partial(run_routing,
                       world_size=world_size,
                       port=free_port(),
                       rs=rs,
                       hidden_size=hidden_size,
-                       data_type=data_type)
+                       data_type=data_type,
+                       router=router)
    mp.spawn(run_func, nprocs=world_size)


 if __name__ == '__main__':
-    test_moe_top2(2, 256, torch.float16)
+    test_moe_kernel(2, 256, torch.float16, Top2Router)
--- a/tests/test_moe/test_moe_group.py
+++ b/tests/test_moe/test_moe_group.py
@@ -0,0 +1,70 @@
+from functools import partial
+import pytest
+import torch
+import torch.nn as nn
+import torch.multiprocessing as mp
+import torch.distributed as dist
+import colossalai
+from colossalai.utils import free_port, get_current_device
+from colossalai.nn.layer.moe import Experts
+from colossalai.core import MOE_CONTEXT
+from colossalai.utils.moe import sync_moe_model_param
+from colossalai.testing import assert_equal_in_group
+
+D_MODEL = 4
+D_FF = 8
+CONFIG = dict()
+
+
+def run_test(rank, world_size, port):
+    colossalai.launch(config=CONFIG, rank=rank, world_size=world_size, host='localhost', port=port, backend='nccl')
+    expert_module = nn.Linear
+    expert_factor = dict(in_features=D_MODEL, out_features=D_FF, device=get_current_device())
+
+    MOE_CONTEXT.setup(42)    # MOE environment initialization
+    exp0 = Experts(expert_module, 1, **expert_factor)
+    exp1 = Experts(expert_module, 2, **expert_factor)
+    exp2 = Experts(expert_module, 4, **expert_factor)
+    exp3 = Experts(expert_module, 8, **expert_factor)
+
+    assert exp0.num_local_experts == 1
+    assert exp1.num_local_experts == 1
+    assert exp2.num_local_experts == 1
+    assert exp3.num_local_experts == 2
+    # experts deployment passed
+
+    dist_dict = MOE_CONTEXT.information
+    rank = dist.get_rank()
+
+    assert len(dist_dict) == 3
+    assert dist.get_rank(dist_dict[4].ep_group) == rank
+    assert dist.get_rank(dist_dict[2].ep_group) == rank % 2
+    assert dist.get_rank(dist_dict[1].ep_group) == 0
+
+    assert dist.get_rank(dist_dict[4].dp_group) == 0
+    assert dist.get_rank(dist_dict[2].dp_group) == rank // 2
+    assert dist.get_rank(dist_dict[1].dp_group) == rank
+    # group creation passed
+
+    model = nn.ModuleList([exp0, exp1, exp2, exp3])
+    model = model.to(get_current_device())
+    sync_moe_model_param(model)
+
+    assert_equal_in_group(exp0.experts[0].weight.data, dist_dict[1].dp_group)
+    assert_equal_in_group(exp0.experts[0].bias.data, dist_dict[1].dp_group)
+    # MOE experts layout success when ep_size = 1
+
+    assert_equal_in_group(exp1.experts[0].weight.data, dist_dict[2].dp_group)
+    assert_equal_in_group(exp1.experts[0].bias.data, dist_dict[2].dp_group)
+    # MOE experts layout success when ep_size = 2
+
+
+@pytest.mark.dist
+def test_moe_initialization():
+    world_size = 4
+    run_func = partial(run_test, world_size=world_size, port=free_port())
+    mp.spawn(run_func, nprocs=world_size)
+
+
+if __name__ == '__main__':
+    test_moe_initialization()
--- a/tests/test_moe/test_top1.py
+++ b/tests/test_moe/test_top1.py
@@ -1,97 +0,0 @@
-from functools import partial
-import pytest
-import torch
-import torch.nn as nn
-import torch.multiprocessing as mp
-import colossalai
-from colossalai.context import ParallelMode
-from colossalai.core import global_context as gpc
-from colossalai.utils import free_port, get_current_device
-from colossalai.nn.layer.moe import Top1Router, MoeLayer
-from colossalai.global_variables import moe_env
-
-BATCH_SIZE = 32
-NUM_EXPERTS = 4
-CONFIG = dict(parallel=dict(moe=dict(size=4)))
-
-
-def check_equal(A, B, atol=1e-06):
-    assert torch.allclose(A, B, rtol=0, atol=atol) is True
-
-
-def run_routing(rank, world_size, port, rs=2, hidden_size=128, data_type=torch.float32):
-    colossalai.launch(config=CONFIG, rank=rank, world_size=world_size, host='localhost', port=port, backend='nccl')
-
-    # torch.set_printoptions(precision=30)
-    torch.backends.cuda.matmul.allow_tf32 = False
-    local_rank = gpc.get_local_rank(ParallelMode.GLOBAL)
-    torch.manual_seed(rs + local_rank)
-    moe_env.reset_loss()
-    tokens = torch.randn(BATCH_SIZE, hidden_size, dtype=data_type, device=get_current_device(), requires_grad=True)
-    # print(f"tokens:\n{tokens}")
-    router = Top1Router(1)
-    layer = MoeLayer(hidden_size, NUM_EXPERTS, router, nn.Identity())
-    if data_type == torch.float16:
-        layer = layer.half()
-    layer.cuda_mode = False
-
-    old_out = layer(tokens)
-    # print(f"old output:\n{old_out}")
-
-    ech = old_out.shape
-    grad = torch.randn(ech, device=get_current_device())
-    old_out.backward(grad)
-
-    o_tk_grad = tokens.grad.data.clone()
-    o_gt_grad = layer.gate.weight.grad.data.clone()
-
-    tokens.grad.zero_()
-    layer.gate.weight.grad.zero_()
-
-    layer.cuda_mode = True
-    new_out = layer(tokens)
-
-    # print(torch.max(torch.abs(old_out - new_out)))
-    if data_type == torch.float32:
-        check_equal(old_out, new_out)
-    else:
-        check_equal(old_out, new_out, 1e-2)
-    # print(f"forward functions passed")
-
-    # print(f"new output:\n{new_out}")
-    new_out.backward(grad)
-    n_tk_grad = tokens.grad.data.clone()
-    n_gt_grad = layer.gate.weight.grad.data.clone()
-
-    # print(torch.max(torch.abs(o_tk_grad - n_tk_grad)))
-    if data_type == torch.float32:
-        check_equal(o_tk_grad, n_tk_grad)
-    else:
-        check_equal(o_tk_grad, o_tk_grad, 1e-2)
-    # print(f"tokens gradient passed")
-
-    # print(torch.max(torch.abs(o_gt_grad - n_gt_grad)))
-    if data_type == torch.float32:
-        check_equal(o_gt_grad, n_gt_grad, 5e-05)
-    else:
-        check_equal(o_gt_grad, n_gt_grad, 2e-01)
-    # print(f"linear weight gradient passed")
-
-
-@pytest.mark.skip(reason="Should be activated for detailed tests")
-@pytest.mark.parametrize("rs", [2, 42, 60])
-@pytest.mark.parametrize("hidden_size", [128, 256, 512, 768, 1024, 2048])
-@pytest.mark.parametrize("data_type", [torch.float32, torch.float16])
-def test_moe_top2(rs, hidden_size, data_type):
-    world_size = 4
-    run_func = partial(run_routing,
-                       world_size=world_size,
-                       port=free_port(),
-                       rs=rs,
-                       hidden_size=hidden_size,
-                       data_type=data_type)
-    mp.spawn(run_func, nprocs=world_size)
-
-
-if __name__ == '__main__':
-    test_moe_top2(60, 512, torch.float16)
--- a/tests/test_moe/test_top2.py
+++ b/tests/test_moe/test_top2.py
@@ -1,97 +0,0 @@
-from functools import partial
-import pytest
-import torch
-import torch.nn as nn
-import torch.multiprocessing as mp
-import colossalai
-from colossalai.context import ParallelMode
-from colossalai.core import global_context as gpc
-from colossalai.utils import free_port, get_current_device
-from colossalai.nn.layer.moe import Top2Router, MoeLayer
-from colossalai.global_variables import moe_env
-
-BATCH_SIZE = 32
-NUM_EXPERTS = 4
-CONFIG = dict(parallel=dict(moe=dict(size=4)))
-
-
-def check_equal(A, B, atol=1e-06):
-    assert torch.allclose(A, B, rtol=0, atol=atol) is True
-
-
-def run_routing(rank, world_size, port, rs=2, hidden_size=128, data_type=torch.float32):
-    colossalai.launch(config=CONFIG, rank=rank, world_size=world_size, host='localhost', port=port, backend='nccl')
-
-    # torch.set_printoptions(precision=30)
-    torch.backends.cuda.matmul.allow_tf32 = False
-    local_rank = gpc.get_local_rank(ParallelMode.GLOBAL)
-    torch.manual_seed(rs + local_rank)
-    moe_env.reset_loss()
-    tokens = torch.randn(BATCH_SIZE, hidden_size, dtype=data_type, device=get_current_device(), requires_grad=True)
-    # print(f"tokens:\n{tokens}")
-    router = Top2Router(1)
-    layer = MoeLayer(hidden_size, NUM_EXPERTS, router, nn.Identity())
-    if data_type == torch.float16:
-        layer = layer.half()
-    layer.cuda_mode = False
-
-    old_out = layer(tokens)
-    # print(f"old output:\n{old_out}")
-
-    ech = old_out.shape
-    grad = torch.randn(ech, device=get_current_device())
-    old_out.backward(grad)
-
-    o_tk_grad = tokens.grad.data.clone()
-    o_gt_grad = layer.gate.weight.grad.data.clone()
-
-    tokens.grad.zero_()
-    layer.gate.weight.grad.zero_()
-
-    layer.cuda_mode = True
-    new_out = layer(tokens)
-
-    # print(torch.max(torch.abs(old_out - new_out)))
-    if data_type == torch.float32:
-        check_equal(old_out, new_out)
-    else:
-        check_equal(old_out, new_out, 1e-2)
-    # print(f"forward functions passed")
-
-    # print(f"new output:\n{new_out}")
-    new_out.backward(grad)
-    n_tk_grad = tokens.grad.data.clone()
-    n_gt_grad = layer.gate.weight.grad.data.clone()
-
-    # print(torch.max(torch.abs(o_tk_grad - n_tk_grad)))
-    if data_type == torch.float32:
-        check_equal(o_tk_grad, n_tk_grad)
-    else:
-        check_equal(o_tk_grad, o_tk_grad, 1e-2)
-    # print(f"tokens gradient passed")
-
-    # print(torch.max(torch.abs(o_gt_grad - n_gt_grad)))
-    if data_type == torch.float32:
-        check_equal(o_gt_grad, n_gt_grad, 5e-05)
-    else:
-        check_equal(o_gt_grad, n_gt_grad, 2e-01)
-    # print(f"linear weight gradient passed")
-
-
-@pytest.mark.skip(reason="Should be activated for detailed tests")
-@pytest.mark.parametrize("rs", [2, 42, 60])
-@pytest.mark.parametrize("hidden_size", [128, 256, 512, 768, 1024, 2048])
-@pytest.mark.parametrize("data_type", [torch.float32, torch.float16])
-def test_moe_top2(rs, hidden_size, data_type):
-    world_size = 4
-    run_func = partial(run_routing,
-                       world_size=world_size,
-                       port=free_port(),
-                       rs=rs,
-                       hidden_size=hidden_size,
-                       data_type=data_type)
-    mp.spawn(run_func, nprocs=world_size)
-
-
-if __name__ == '__main__':
-    test_moe_top2(2, 256, torch.float16)