2023 · arXiv preprintScaling Expert Language Models with Unsupervised Domain DiscoverySuchin Gururangan, Margaret Li, Mike Lewis, Weijia Shi, Tim Althoff, Noah A. Smith, Luke ZettlemoyerRead morePDF
2022 · arXiv preprintBranch-Train-Merge: Embarrassingly Parallel Training of Expert Language ModelsMargaret Li, Suchin Gururangan, Tim Dettmers, Mike Lewis, Tim Althoff, Noah A. Smith, Luke ZettlemoyerRead morePDF