Cette thèse vise à présenter une méthode complète permettant d'extraire des règles grammaticales quantitatives et interprétables à partir de treebanks syntaxiques. Cet objectif s'inscrit dans le cadre des grammaires descriptives, qui nécessitent des analyses fines pour saisir des phénomènes linguistiques complexes tout en intégrant les propriétés fondamentales du langage. Pour y parvenir, nous proposons une formalisation générale des règles grammaticales issues de corpus, facile à généraliser et à mettre en œuvre à l'aide de méthodes automatisées. Les règles extraites sont concises, ont différents niveaux de granularité, permettent une sélection flexible et sont ordonnées par importance. Ces descriptions formelles sont extraites de corpus à l'aide de modèles de régression logistique parcimonieux, qui favorisent l'interprétabilité tout en produisant un ensemble concis de règles présentant les propriétés souhaitées. Les résultats de notre méthode sont évalués dans plusieurs langues afin d'examiner sa capacité à répondre aux besoins descriptifs et comparés à d'autres approches existantes. La méthodologie est ensuite étendue à la description contrastive des langues, mettant en évidence les différences et les similitudes entre les langues. Cette approche permet d'obtenir des signatures linguistiques, des ensembles de modèles communs et distinctifs qui profilent chaque langue. Les expériences portent sur plusieurs paires de langues, familles de langues et genres textuels. Une attention particulière est accordée à la nature des règles extraites et au rôle des connaissances linguistiques théoriques dans le processus d'extraction. Cette thèse vise en fin de compte à démontrer la faisabilité de l'extraction d'une grammaire guidée par le corpus pour la description des langues. Ainsi, elle étend les liens entre la linguistique descriptive, formelle et computationnelle dans le contexte plus large de la description des langues.