Loading fairseq/models/transformer.py +1 −1 Changes for fairseq/models/transformer.py: 1 added line, 1 removed line. Original line number Diff line number Diff line Loading @@ -480,7 +480,7 @@ def transformer_wmt_en_de_big(args): @register_model_architecture('transformer', 'transformer_wmt_en_de_big_t2t') def transformer_wmt_en_de_big_t2t(args): args.encoder_normalize_before = getattr(args, 'encoder_normalize_before', True) args.encoder_normalize_before = getattr(args, 'decoder_normalize_before', True) args.decoder_normalize_before = getattr(args, 'decoder_normalize_before', True) args.attention_dropout = getattr(args, 'attention_dropout', 0.1) args.relu_dropout = getattr(args, 'relu_dropout', 0.1) transformer_vaswani_wmt_en_de_big(args) Loading
fairseq/models/transformer.py +1 −1 Changes for fairseq/models/transformer.py: 1 added line, 1 removed line. Original line number Diff line number Diff line Loading @@ -480,7 +480,7 @@ def transformer_wmt_en_de_big(args): @register_model_architecture('transformer', 'transformer_wmt_en_de_big_t2t') def transformer_wmt_en_de_big_t2t(args): args.encoder_normalize_before = getattr(args, 'encoder_normalize_before', True) args.encoder_normalize_before = getattr(args, 'decoder_normalize_before', True) args.decoder_normalize_before = getattr(args, 'decoder_normalize_before', True) args.attention_dropout = getattr(args, 'attention_dropout', 0.1) args.relu_dropout = getattr(args, 'relu_dropout', 0.1) transformer_vaswani_wmt_en_de_big(args)