Python计算IV值的示例讲解--688IT编程网

Python计算IV值的⽰例讲解

在对变量分箱后，需要计算变量的重要性，IV是评估变量区分度或重要性的统计量之⼀，python计算IV值的代码如下：def CalcIV(Xvar, Yvar):

N_0 = np.sum(Yvar==0)

N_1 = np.sum(Yvar==1)

N_0_group = np.zeros(np.unique(Xvar).shape)

N_1_group = np.zeros(np.unique(Xvar).shape)

for i in range(len(np.unique(Xvar))):

N_0_group[i] = Yvar[(Xvar == np.unique(Xvar)[i]) & (Yvar == 0)].count()

N_1_group[i] = Yvar[(Xvar == np.unique(Xvar)[i]) & (Yvar == 1)].count()

iv = np.sum((N_0_group/N_0 - N_1_group/N_1) * np.log((N_0_group/N_0)/(N_1_group/N_1)))

return iv

def caliv_batch(df, Kvar, Yvar):

df_Xvar = df.drop([Kvar, Yvar], axis=1)

ivlist = []

for col in lumns:

iv = CalcIV(df[col], df[Yvar])

ivlist.append(iv)

names = list(lumns)

iv_df = pd.DataFrame({'Var': names, 'Iv': ivlist}, columns=['Var', 'Iv'])

return iv_df

其中，df是分箱后的数据集，Kvar是主键，Yvar是y变量(0是好，1是坏)。

代码运⾏结果如下：

补充拓展：python基础IV(切⽚、迭代、⽣成列表)

对list进⾏切⽚

取⼀个list的部分元素是⾮常常见的操作。⽐如，⼀个list如下：

>>> L = ['Adam', 'Lisa', 'Bart', 'Paul']

取前3个元素，应该怎么做？

笨办法：

>>> [L[0], L[1], L[2]]

['Adam', 'Lisa', 'Bart']

之所以是笨办法是因为扩展⼀下，取前N个元素就没辙了。

取前N个元素，也就是索引为0-(N-1)的元素，可以⽤循环：

>>> r = []

>>> n = 3

>>> for i in range(n):

... r.append(L[i])

...

>>> r

python中字符串是什么['Adam', 'Lisa', 'Bart']

对这种经常取指定索引范围的操作，⽤循环⼗分繁琐，因此，Python提供了切⽚（Slice）操作符，能⼤⼤简化这种操作。对应上⾯的问题，取前3个元素，⽤⼀⾏代码就可以完成切⽚：

>>> L[0:3]

['Adam', 'Lisa', 'Bart']

L[0:3]表⽰，从索引0开始取，直到索引3为⽌，但不包括索引3。即索引0，1，2，正好是3个元素。

如果第⼀个索引是0，还可以省略：

>>> L[:3]

['Adam', 'Lisa', 'Bart']

也可以从索引1开始，取出2个元素出来：

>>> L[1:3]

['Lisa', 'Bart']

只⽤⼀个 : ，表⽰从头到尾：

>>> L[:]

['Adam', 'Lisa', 'Bart', 'Paul']

因此，L[:]实际上复制出了⼀个新list。

切⽚操作还可以指定第三个参数：

>>> L[::2]

['Adam', 'Bart']

第三个参数表⽰每N个取⼀个，上⾯的 L[::2] 会每两个元素取出⼀个来，也就是隔⼀个取⼀个。

把list换成tuple，切⽚操作完全相同，只是切⽚的结果也变成了tuple。

倒序切⽚

对于list，既然Python⽀持L[-1]取倒数第⼀个元素，那么它同样⽀持倒数切⽚，试试：

>>> L = ['Adam', 'Lisa', 'Bart', 'Paul']

>>> L[-2:]

['Bart', 'Paul']

>>> L[:-2]

['Adam', 'Lisa']

>>> L[-3:-1]

['Lisa', 'Bart']

>>> L[-4:-1:2]

['Adam', 'Bart']

记住倒数第⼀个元素的索引是-1。倒序切⽚包含起始索引，不包含结束索引。

对字符串切⽚

字符串 'xxx'和 Unicode字符串 u'xxx'也可以看成是⼀种list，每个元素就是⼀个字符。因此，字符串也可以⽤切⽚操作，只是操作结果仍是字符串：

>>> 'ABCDEFG'[:3]

'ABC'

>>> 'ABCDEFG'[-3:]

'EFG'

>>> 'ABCDEFG'[::2]

'ACEG'

在很多编程语⾔中，针对字符串提供了很多各种截取函数，其实⽬的就是对字符串切⽚。Python没有针对字符串的截取函数，只需要切⽚⼀个操作就可以完成，⾮常简单。

什么是迭代

在Python中，如果给定⼀个list或tuple，我们可以通过for循环来遍历这个list或tuple，这种遍历我们成为迭代（Iteration）。

在Python中，迭代是通过 for ... in 来完成的，⽽很多语⾔⽐如C或者Java，迭代list是通过下标完成的，⽐如Java代码：

for (i=0; i<list.length; i++) {

n = list[i];

}

可以看出，Python的for循环抽象程度要⾼于Java的for循环。

因为 Python 的 for循环不仅可以⽤在list或tuple上，还可以作⽤在其他任何可迭代对象上。

因此，迭代操作就是对于⼀个集合，⽆论该集合是有序还是⽆序，我们⽤ for 循环总是可以依次取出集合的每⼀个元素。

注意: 集合是指包含⼀组元素的数据结构，我们已经介绍的包括：

1. 有序集合：list，tuple，str和unicode；

2. ⽆序集合：set

3. ⽆序集合并且具有 key-value 对：dict

⽽迭代是⼀个动词，它指的是⼀种操作，在Python中，就是 for 循环。

迭代与按下标访问数组最⼤的不同是，后者是⼀种具体的迭代实现⽅式，⽽前者只关⼼迭代结果，根本不关⼼迭代内部是如何实现的。

索引迭代

Python中，迭代永远是取出元素本⾝，⽽⾮元素的索引。

对于有序集合，元素确实是有索引的。有的时候，我们确实想在 for 循环中拿到索引，怎么办？

⽅法是使⽤ enumerate() 函数：

>>> L = ['Adam', 'Lisa', 'Bart', 'Paul']

>>> for index, name in enumerate(L):

... print index, '-', name

...

0 - Adam

1 - Lisa

2 - Bart

3 - Paul

使⽤ enumerate() 函数，我们可以在for循环中同时绑定索引index和元素name。但是，这不是 enumerate() 的特殊语法。实际上，enumerate() 函数把：

['Adam', 'Lisa', 'Bart', 'Paul']

变成了类似：

[(0, 'Adam'), (1, 'Lisa'), (2, 'Bart'), (3, 'Paul')]

因此，迭代的每⼀个元素实际上是⼀个tuple：

for t in enumerate(L):

index = t[0]

name = t[1]

print index, '-', name

如果我们知道每个tuple元素都包含两个元素，for循环⼜可以进⼀步简写为：

for index, name in enumerate(L):

print index, '-', name

这样不但代码更简单，⽽且还少了两条赋值语句。

可见，索引迭代也不是真的按索引访问，⽽是由 enumerate() 函数⾃动把每个元素变成 (index, element) 这样的tuple，再迭代，就同时获得了索引和元素本⾝。

迭代dict的value

我们已经了解了dict对象本⾝就是可迭代对象，⽤ for 循环直接迭代 dict，可以每次拿到dict的⼀个key。

如果我们希望迭代 dict 对象的value，应该怎么做？

dict 对象有⼀个 values() ⽅法，这个⽅法把dict转换成⼀个包含所有value的list，这样，我们迭代的就是 dict的每⼀个 value：d = { 'Adam': 95, 'Lisa': 85, 'Bart': 59 }

print d.values()

# [85, 95, 59]

for v in d.values():

print v

# 85

# 95

# 59

如果仔细阅读Python的⽂档，还可以发现，dict除了values()⽅法外，还有⼀个 itervalues() ⽅法，⽤ itervalues() ⽅法替代values() ⽅法，迭代效果完全⼀样：

d = { 'Adam': 95, 'Lisa': 85, 'Bart': 59 }

print d.itervalues()

# <dictionary-valueiterator object at 0x106adbb50>

for v in d.itervalues():

print v

# 85

# 95

# 59

那这两个⽅法有何不同之处呢？

1. values() ⽅法实际上把⼀个 dict 转换成了包含 value 的list。

2. 但是 itervalues() ⽅法不会转换，它会在迭代过程中依次从 dict 中取出 value，所以 itervalues() ⽅法⽐ values() ⽅法节省了⽣成 list 所需的内存。

3. 打印 itervalues() 发现它返回⼀个 <dictionary-valueiterator> 对象，这说明在Python中，for 循环可作⽤的迭代对象远不⽌list，tuple，str，unicode，dict等，任何可迭代对象都可以作⽤于for循环，⽽内部如何迭代我们通常并不⽤关⼼。

如果⼀个对象说⾃⼰可迭代，那我们就直接⽤ for 循环去迭代它，可见，迭代是⼀种抽象的数据操作，它不对迭代对象内部的数据有任何要求。

迭代dict的key和value

我们了解了如何迭代 dict 的key和value，那么，在⼀个 for 循环中，能否同时迭代 key和value？答案是肯定的。

⾸先，我们看看 dict 对象的 items() ⽅法返回的值：

>>> d = { 'Adam': 95, 'Lisa': 85, 'Bart': 59 }

>>> print d.items()

[('Lisa', 85), ('Adam', 95), ('Bart', 59)]

可以看到，items() ⽅法把dict对象转换成了包含tuple的list，我们对这个list进⾏迭代，可以同时获得key和value：

>>> for key, value in d.items():

... print key, ':', value

...

Lisa : 85

Adam : 95

Bart : 59

和 values() 有⼀个 itervalues() 类似， items() 也有⼀个对应的 iteritems()，iteritems() 不把dict转换成list，⽽是在迭代过程中不断给出 tuple，所以， iteritems() 不占⽤额外的内存。

⽣成列表

要⽣成list [1, 2, 3, 4, 5, 6, 7, 8, 9, 10]，我们可以⽤range(1, 11)：

>>> range(1, 11)

[1, 2, 3, 4, 5, 6, 7, 8, 9, 10]

但如果要⽣成[1x1, 2x2, 3x3, ..., 10x10]怎么做？⽅法⼀是循环：

>>> L = []

>>> for x in range(1, 11):

... L.append(x * x)

...

>>> L

[1, 4, 9, 16, 25, 36, 49, 64, 81, 100]

但是循环太繁琐，⽽列表⽣成式则可以⽤⼀⾏语句代替循环⽣成上⾯的list：

>>> [x * x for x in range(1, 11)]

[1, 4, 9, 16, 25, 36, 49, 64, 81, 100]

这种写法就是Python特有的列表⽣成式。利⽤列表⽣成式，可以以⾮常简洁的代码⽣成 list。

写列表⽣成式时，把要⽣成的元素 x * x 放到前⾯，后⾯跟 for 循环，就可以把list创建出来，⼗分有⽤，多写⼏次，很快就可以熟悉这种语法。

复杂表达式

使⽤for循环的迭代不仅可以迭代普通的list，还可以迭代dict。

假设有如下的dict：

d = { 'Adam': 95, 'Lisa': 85, 'Bart': 59 }

完全可以通过⼀个复杂的列表⽣成式把它变成⼀个 HTML 表格：

tds = ['<tr><td>%s</td><td>%s</td></tr>' % (name, score) for name, score in d.iteritems()]

print '<table>'

print '<tr><th>Name</th><th>Score</th><tr>'

print '\n'.join(tds)

print '</table>'

注：字符串可以通过 % 进⾏格式化，⽤指定的参数替代 %s。字符串的join()⽅法可以把⼀个 list 拼接成⼀个字符串。

条件过滤

列表⽣成式的 for 循环后⾯还可以加上 if 判断。例如：

>>> [x * x for x in range(1, 11)]

[1, 4, 9, 16, 25, 36, 49, 64, 81, 100]

如果我们只想要偶数的平⽅，不改动 range()的情况下，可以加上 if 来筛选：

>>> [x * x for x in range(1, 11) if x % 2 == 0]

[4, 16, 36, 64, 100]

有了 if 条件，只有 if 判断为 True 的时候，才把循环的当前元素添加到列表中。

多层表达式

for循环可以嵌套，因此，在列表⽣成式中，也可以⽤多层 for 循环来⽣成列表。

对于字符串 'ABC' 和 '123'，可以使⽤两层循环，⽣成全排列：

>>> [m + n for m in 'ABC' for n in '123']

['A1', 'A2', 'A3', 'B1', 'B2', 'B3', 'C1', 'C2', 'C3']

翻译成循环代码就像下⾯这样：

688IT编程网

Python计算IV值的示例讲解

发表评论

推荐文章

java正则表达式选择题

一种基于正则表达式的DBC文件解析及报文分析方法[发明专利]

工龄小数点提取

非零金额正则表达式

提取文本中数字的函数

热门文章

excel文字递增函数公式

数字递增公式

notepad 正则变量运算

C++regex库常用函数及实例

js正则表达式之前瞻后顾与非捕获分组

indesign正则数字和英文之间的空格

C#匹配中文字符串的4种正则表达式分享

PHP正则表达式匹配中文字符

匹配中文汉字的正则表达式介绍

Python正则表达式如何进行字符串替换

orcl中用正则表达式

sql正则表达式excel

dataframe正则表达式

postgress sql正则

el-upload accept 正则表达式

半小时正则表达式

判断科学计数法的正则

根据url判断静态资源的方法

Java正则表达式-匹配正负浮点数

替换模糊匹配正则-hive

最新文章

一种基于正则表达式的DBC文件解析及报文分析方法[发明专利]

能被5整除的十进制整数的正规表达式

大于0小于等于1的正则表达式

linux grep 26个字母

java pattern 正则表达式

掌握文本编辑器中的搜索和替换技巧

标签列表

688IT编程网

Python计算IV值的示例讲解

发表评论

推荐文章

java正则表达式 选择题

一种基于正则表达式的DBC文件解析及报文分析方法[发明专利]

工龄小数点提取

非零金额 正则表达式

提取文本中数字的函数

热门文章

excel文字递增函数公式

数字递增公式

notepad 正则变量运算

C++regex库常用函数及实例

js正则表达式之前瞻后顾与非捕获分组

indesign正则数字和英文之间的空格

C#匹配中文字符串的4种正则表达式分享

PHP正则表达式匹配中文字符

匹配中文汉字的正则表达式介绍

Python正则表达式如何进行字符串替换

orcl中用正则表达式

sql正则表达式excel

dataframe正则表达式

postgress sql正则

el-upload accept 正则表达式

半小时 正则表达式

判断科学计数法的正则

根据url判断静态资源的方法

Java正则表达式-匹配正负浮点数

替换模糊匹配正则-hive

最新文章

一种基于正则表达式的DBC文件解析及报文分析方法[发明专利]

能被5整除的十进制整数的正规表达式

大于0小于等于1的正则表达式

linux grep 26个字母

java pattern 正则表达式

掌握文本编辑器中的搜索和替换技巧

标签列表

java正则表达式选择题

非零金额正则表达式

半小时正则表达式