引言
数据分析是当今数据驱动决策的关键环节,它不仅需要扎实的理论基础,还需要丰富的实战经验。本文将围绕数据分析领域的难题,通过一系列实战测试题,帮助读者快速提升数据处理技能。
一、数据清洗与预处理
1.1 数据缺失处理
问题:给定一个包含缺失值的DataFrame,请编写代码填充缺失值。
import pandas as pd
import numpy as np
# 创建含有缺失值的DataFrame
data = {'Age': [25, np.nan, 30, 22, np.nan],
'Salary': [50000, 60000, np.nan, 45000, 55000]}
df = pd.DataFrame(data)
# 使用均值填充缺失值
df['Age'].fillna(df['Age'].mean(), inplace=True)
df['Salary'].fillna(df['Salary'].mean(), inplace=True)
print(df)
1.2 异常值处理
问题:给定一个包含异常值的DataFrame,请编写代码去除异常值。
# 使用Z-Score方法去除异常值
from scipy import stats
df['Age'] = stats.zscore(df['Age'])
df = df[(df['Age'] > -3) & (df['Age'] < 3)]
print(df)
二、数据探索与分析
2.1 描述性统计
问题:给定一个DataFrame,请编写代码计算各列的描述性统计。
print(df.describe())
2.2 数据可视化
问题:给定一个DataFrame,请使用matplotlib绘制散点图,展示’Age’和’Salary’之间的关系。
import matplotlib.pyplot as plt
plt.scatter(df['Age'], df['Salary'])
plt.xlabel('Age')
plt.ylabel('Salary')
plt.show()
三、数据建模与预测
3.1 线性回归
问题:给定一个包含自变量X和因变量Y的DataFrame,请使用线性回归模型预测Y。
from sklearn.linear_model import LinearRegression
# 创建线性回归模型
model = LinearRegression()
# 训练模型
model.fit(X, Y)
# 预测Y
Y_pred = model.predict(X_test)
print(Y_pred)
3.2 决策树
问题:给定一个分类数据集,请使用决策树模型进行分类。
from sklearn.tree import DecisionTreeClassifier
# 创建决策树模型
model = DecisionTreeClassifier()
# 训练模型
model.fit(X, Y)
# 预测类别
Y_pred = model.predict(X_test)
print(Y_pred)
结论
通过以上实战测试题,读者可以了解到数据分析过程中的关键步骤,并掌握相应的编程技能。在实际工作中,不断练习和总结,才能成为一名优秀的数据分析师。
