ColossalAI/tests/test_shardformer/test_model/_utils.py

import copy

from colossalai.shardformer import ShardConfig, ShardFormer


def build_model(model_fn):
    # create new model
    org_model = model_fn().cuda()

    # shard model
    shard_config = ShardConfig(enable_fused_normalization=True)
    model_copy = copy.deepcopy(org_model)
    shard_former = ShardFormer(shard_config=shard_config)
    sharded_model = shard_former.shard_model(model_copy).cuda()
    return org_model, sharded_model


def run_forward(original_model, sharded_model, data_gen_fn, output_transform_fn, loss_fn):
    # prepare input
    data = data_gen_fn()
    data = {k: v.cuda() for k, v in data.items()}

    # switch to train mode
    original_model.train()
    sharded_model.train()
    # run forward
    org_output = original_model(**data)
    org_output = output_transform_fn(org_output)
    org_loss = loss_fn(org_output)

    shard_output = sharded_model(**data)
    shard_output = output_transform_fn(shard_output)
    shard_loss = loss_fn(shard_output)
    return org_output, org_loss, shard_output, shard_loss
[shardformer] adapted T5 and LLaMa test to use kit (#4049) * [shardformer] adapted T5 and LLaMa test to use kit * polish code 2023-06-21 01:32:46 +00:00			`import copy`

			`from colossalai.shardformer import ShardConfig, ShardFormer`


[shardformer] integrate with data parallelism (#4103) 2023-06-30 01:58:08 +00:00			`def build_model(model_fn):`
[shardformer] adapted T5 and LLaMa test to use kit (#4049) * [shardformer] adapted T5 and LLaMa test to use kit * polish code 2023-06-21 01:32:46 +00:00			`# create new model`
			`org_model = model_fn().cuda()`

			`# shard model`
[shardformer] integrate with data parallelism (#4103) 2023-06-30 01:58:08 +00:00			`shard_config = ShardConfig(enable_fused_normalization=True)`
[shardformer] adapted T5 and LLaMa test to use kit (#4049) * [shardformer] adapted T5 and LLaMa test to use kit * polish code 2023-06-21 01:32:46 +00:00			`model_copy = copy.deepcopy(org_model)`
			`shard_former = ShardFormer(shard_config=shard_config)`
[shardformer] supported fused normalization (#4112) 2023-06-30 01:32:37 +00:00			`sharded_model = shard_former.shard_model(model_copy).cuda()`
[shardformer] adapted T5 and LLaMa test to use kit (#4049) * [shardformer] adapted T5 and LLaMa test to use kit * polish code 2023-06-21 01:32:46 +00:00			`return org_model, sharded_model`


			`def run_forward(original_model, sharded_model, data_gen_fn, output_transform_fn, loss_fn):`
			`# prepare input`
			`data = data_gen_fn()`
			`data = {k: v.cuda() for k, v in data.items()}`

			`# switch to train mode`
			`original_model.train()`
			`sharded_model.train()`
			`# run forward`
			`org_output = original_model(**data)`
			`org_output = output_transform_fn(org_output)`
			`org_loss = loss_fn(org_output)`

			`shard_output = sharded_model(**data)`
			`shard_output = output_transform_fn(shard_output)`
			`shard_loss = loss_fn(shard_output)`
[shardformer] supported fused normalization (#4112) 2023-06-30 01:32:37 +00:00			`return org_output, org_loss, shard_output, shard_loss`