What is Data Cleaning?
Data cleaning is the process of detecting and fixing (or removing) inaccurate, duplicate, malformed, or missing values so analysis and models train on trustworthy inputs.
Typical steps: drop invalid rows, standardize formats and categories, handle outliers deliberately, and impute or model missingness. Cleaning choices should be documented—they are part of the data contract.
Authoritative reference: Wikipedia: Data cleansing