How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data Paper • 2604.13977 • Published Apr 15
On the Utility and Factual Reliability of Pruned Mixture-of-Experts Models in the Biomedical Domain Paper • 2607.01444 • Published 28 days ago • 2
Enhancing Linguistic Competence of Language Models through Pre-training with Language Learning Tasks Paper • 2601.03448 • Published Jan 6 • 13
Enhancing Linguistic Competence of Language Models through Pre-training with Language Learning Tasks Paper • 2601.03448 • Published Jan 6 • 13
Mitigating Catastrophic Forgetting in Target Language Adaptation of LLMs via Source-Shielded Updates Paper • 2512.04844 • Published Dec 4, 2025 • 5