Python计算IV值的⽰例讲解
在对变量分箱后,需要计算变量的重要性,IV是评估变量区分度或重要性的统计量之⼀,python计算IV值的代码如下:def CalcIV(Xvar, Yvar):
N_0 = np.sum(Yvar==0)
N_1 = np.sum(Yvar==1)
N_0_group = np.zeros(np.unique(Xvar).shape)
N_1_group = np.zeros(np.unique(Xvar).shape)
for i in range(len(np.unique(Xvar))):
N_0_group[i] = Yvar[(Xvar == np.unique(Xvar)[i]) & (Yvar == 0)].count()
N_1_group[i] = Yvar[(Xvar == np.unique(Xvar)[i]) & (Yvar == 1)].count()
iv = np.sum((N_0_group/N_0 - N_1_group/N_1) * np.log((N_0_group/N_0)/(N_1_group/N_1)))
return iv
def caliv_batch(df, Kvar, Yvar):
df_Xvar = df.drop([Kvar, Yvar], axis=1)
ivlist = []
for col in lumns:
iv = CalcIV(df[col], df[Yvar])
ivlist.append(iv)
names = list(lumns)
iv_df = pd.DataFrame({'Var': names, 'Iv': ivlist}, columns=['Var', 'Iv'])
return iv_df
其中,df是分箱后的数据集,Kvar是主键,Yvar是y变量(0是好,1是坏)。
代码运⾏结果如下:
补充拓展:python基础IV(切⽚、迭代、⽣成列表)
对list进⾏切⽚
取⼀个list的部分元素是⾮常常见的操作。⽐如,⼀个list如下:
>>> L = ['Adam', 'Lisa', 'Bart', 'Paul']
取前3个元素,应该怎么做?
笨办法:
>>> [L[0], L[1], L[2]]
['Adam', 'Lisa', 'Bart']
之所以是笨办法是因为扩展⼀下,取前N个元素就没辙了。
取前N个元素,也就是索引为0-(N-1)的元素,可以⽤循环:
>>> r = []
>>> n = 3
>>> for i in range(n):
... r.append(L[i])
...
>>> r
python中字符串是什么['Adam', 'Lisa', 'Bart']
对这种经常取指定索引范围的操作,⽤循环⼗分繁琐,因此,Python提供了切⽚(Slice)操作符,能⼤⼤简化这种操作。对应上⾯的问题,取前3个元素,⽤⼀⾏代码就可以完成切⽚:
>>> L[0:3]
['Adam', 'Lisa', 'Bart']
L[0:3]表⽰,从索引0开始取,直到索引3为⽌,但不包括索引3。即索引0,1,2,正好是3个元素。
如果第⼀个索引是0,还可以省略:
>>> L[:3]
['Adam', 'Lisa', 'Bart']
也可以从索引1开始,取出2个元素出来:
>>> L[1:3]
['Lisa', 'Bart']
只⽤⼀个 : ,表⽰从头到尾:
>>> L[:]
['Adam', 'Lisa', 'Bart', 'Paul']
因此,L[:]实际上复制出了⼀个新list。
切⽚操作还可以指定第三个参数:
>>> L[::2]
['Adam', 'Bart']
第三个参数表⽰每N个取⼀个,上⾯的 L[::2] 会每两个元素取出⼀个来,也就是隔⼀个取⼀个。
把list换成tuple,切⽚操作完全相同,只是切⽚的结果也变成了tuple。
倒序切⽚
对于list,既然Python⽀持L[-1]取倒数第⼀个元素,那么它同样⽀持倒数切⽚,试试:
>>> L = ['Adam', 'Lisa', 'Bart', 'Paul']
>>> L[-2:]
['Bart', 'Paul']
>>> L[:-2]
['Adam', 'Lisa']
>>> L[-3:-1]
['Lisa', 'Bart']
>>> L[-4:-1:2]
['Adam', 'Bart']
记住倒数第⼀个元素的索引是-1。倒序切⽚包含起始索引,不包含结束索引。
对字符串切⽚
字符串 'xxx'和 Unicode字符串 u'xxx'也可以看成是⼀种list,每个元素就是⼀个字符。因此,字符串也可以⽤切⽚操作,只是操作结果仍是字符串:
>>> 'ABCDEFG'[:3]
'ABC'
>>> 'ABCDEFG'[-3:]
'EFG'
>>> 'ABCDEFG'[::2]
'ACEG'
在很多编程语⾔中,针对字符串提供了很多各种截取函数,其实⽬的就是对字符串切⽚。Python没有针对字符串的截取函数,只需要切⽚⼀个操作就可以完成,⾮常简单。
什么是迭代
在Python中,如果给定⼀个list或tuple,我们可以通过for循环来遍历这个list或tuple,这种遍历我们成为迭代(Iteration)。
在Python中,迭代是通过 for ... in 来完成的,⽽很多语⾔⽐如C或者Java,迭代list是通过下标完成的,⽐如Java代码:
for (i=0; i<list.length; i++) {
n = list[i];
}
可以看出,Python的for循环抽象程度要⾼于Java的for循环。
因为 Python 的 for循环不仅可以⽤在list或tuple上,还可以作⽤在其他任何可迭代对象上。
因此,迭代操作就是对于⼀个集合,⽆论该集合是有序还是⽆序,我们⽤ for 循环总是可以依次取出集合的每⼀个元素。
注意: 集合是指包含⼀组元素的数据结构,我们已经介绍的包括:
1. 有序集合:list,tuple,str和unicode;
2. ⽆序集合:set
3. ⽆序集合并且具有 key-value 对:dict
⽽迭代是⼀个动词,它指的是⼀种操作,在Python中,就是 for 循环。
迭代与按下标访问数组最⼤的不同是,后者是⼀种具体的迭代实现⽅式,⽽前者只关⼼迭代结果,根本不关⼼迭代内部是如何实现的。
索引迭代
Python中,迭代永远是取出元素本⾝,⽽⾮元素的索引。
对于有序集合,元素确实是有索引的。有的时候,我们确实想在 for 循环中拿到索引,怎么办?
⽅法是使⽤ enumerate() 函数:
>>> L = ['Adam', 'Lisa', 'Bart', 'Paul']
>>> for index, name in enumerate(L):
... print index, '-', name
...
0 - Adam
1 - Lisa
2 - Bart
3 - Paul
使⽤ enumerate() 函数,我们可以在for循环中同时绑定索引index和元素name。但是,这不是 enumerate() 的特殊语法。实际上,enumerate() 函数把:
['Adam', 'Lisa', 'Bart', 'Paul']
变成了类似:
[(0, 'Adam'), (1, 'Lisa'), (2, 'Bart'), (3, 'Paul')]
因此,迭代的每⼀个元素实际上是⼀个tuple:
for t in enumerate(L):
index = t[0]
name = t[1]
print index, '-', name
如果我们知道每个tuple元素都包含两个元素,for循环⼜可以进⼀步简写为:
for index, name in enumerate(L):
print index, '-', name
这样不但代码更简单,⽽且还少了两条赋值语句。
可见,索引迭代也不是真的按索引访问,⽽是由 enumerate() 函数⾃动把每个元素变成 (index, element) 这样的tuple,再迭代,就同时获得了索引和元素本⾝。
迭代dict的value
我们已经了解了dict对象本⾝就是可迭代对象,⽤ for 循环直接迭代 dict,可以每次拿到dict的⼀个key。
如果我们希望迭代 dict 对象的value,应该怎么做?
dict 对象有⼀个 values() ⽅法,这个⽅法把dict转换成⼀个包含所有value的list,这样,我们迭代的就是 dict的每⼀个 value:d = { 'Adam': 95, 'Lisa': 85, 'Bart': 59 }
print d.values()
# [85, 95, 59]
for v in d.values():
print v
# 85
# 95
# 59
如果仔细阅读Python的⽂档,还可以发现,dict除了values()⽅法外,还有⼀个 itervalues() ⽅法,⽤ itervalues() ⽅法替代values() ⽅法,迭代效果完全⼀样:
d = { 'Adam': 95, 'Lisa': 85, 'Bart': 59 }
print d.itervalues()
# <dictionary-valueiterator object at 0x106adbb50>
for v in d.itervalues():
print v
# 85
# 95
# 59
那这两个⽅法有何不同之处呢?
1. values() ⽅法实际上把⼀个 dict 转换成了包含 value 的list。
2. 但是 itervalues() ⽅法不会转换,它会在迭代过程中依次从 dict 中取出 value,所以 itervalues() ⽅法⽐ values() ⽅法节省了⽣成 list 所需的内存。
3. 打印 itervalues() 发现它返回⼀个 <dictionary-valueiterator> 对象,这说明在Python中,for 循环可作⽤的迭代对象远不⽌list,tuple,str,unicode,dict等,任何可迭代对象都可以作⽤于for循环,⽽内部如何迭代我们通常并不⽤关⼼。
如果⼀个对象说⾃⼰可迭代,那我们就直接⽤ for 循环去迭代它,可见,迭代是⼀种抽象的数据操作,它不对迭代对象内部的数据有任何要求。
迭代dict的key和value
我们了解了如何迭代 dict 的key和value,那么,在⼀个 for 循环中,能否同时迭代 key和value?答案是肯定的。
⾸先,我们看看 dict 对象的 items() ⽅法返回的值:
>>> d = { 'Adam': 95, 'Lisa': 85, 'Bart': 59 }
>>> print d.items()
[('Lisa', 85), ('Adam', 95), ('Bart', 59)]
可以看到,items() ⽅法把dict对象转换成了包含tuple的list,我们对这个list进⾏迭代,可以同时获得key和value:
>>> for key, value in d.items():
... print key, ':', value
...
Lisa : 85
Adam : 95
Bart : 59
和 values() 有⼀个 itervalues() 类似, items() 也有⼀个对应的 iteritems(),iteritems() 不把dict转换成list,⽽是在迭代过程中不断给出 tuple,所以, iteritems() 不占⽤额外的内存。
⽣成列表
要⽣成list [1, 2, 3, 4, 5, 6, 7, 8, 9, 10],我们可以⽤range(1, 11):
>>> range(1, 11)
[1, 2, 3, 4, 5, 6, 7, 8, 9, 10]
但如果要⽣成[1x1, 2x2, 3x3, ..., 10x10]怎么做?⽅法⼀是循环:
>>> L = []
>>> for x in range(1, 11):
... L.append(x * x)
...
>>> L
[1, 4, 9, 16, 25, 36, 49, 64, 81, 100]
但是循环太繁琐,⽽列表⽣成式则可以⽤⼀⾏语句代替循环⽣成上⾯的list:
>>> [x * x for x in range(1, 11)]
[1, 4, 9, 16, 25, 36, 49, 64, 81, 100]
这种写法就是Python特有的列表⽣成式。利⽤列表⽣成式,可以以⾮常简洁的代码⽣成 list。
写列表⽣成式时,把要⽣成的元素 x * x 放到前⾯,后⾯跟 for 循环,就可以把list创建出来,⼗分有⽤,多写⼏次,很快就可以熟悉这种语法。
复杂表达式
使⽤for循环的迭代不仅可以迭代普通的list,还可以迭代dict。
假设有如下的dict:
d = { 'Adam': 95, 'Lisa': 85, 'Bart': 59 }
完全可以通过⼀个复杂的列表⽣成式把它变成⼀个 HTML 表格:
tds = ['<tr><td>%s</td><td>%s</td></tr>' % (name, score) for name, score in d.iteritems()]
print '<table>'
print '<tr><th>Name</th><th>Score</th><tr>'
print '\n'.join(tds)
print '</table>'
注:字符串可以通过 % 进⾏格式化,⽤指定的参数替代 %s。字符串的join()⽅法可以把⼀个 list 拼接成⼀个字符串。
条件过滤
列表⽣成式的 for 循环后⾯还可以加上 if 判断。例如:
>>> [x * x for x in range(1, 11)]
[1, 4, 9, 16, 25, 36, 49, 64, 81, 100]
如果我们只想要偶数的平⽅,不改动 range()的情况下,可以加上 if 来筛选:
>>> [x * x for x in range(1, 11) if x % 2 == 0]
[4, 16, 36, 64, 100]
有了 if 条件,只有 if 判断为 True 的时候,才把循环的当前元素添加到列表中。
多层表达式
for循环可以嵌套,因此,在列表⽣成式中,也可以⽤多层 for 循环来⽣成列表。
对于字符串 'ABC' 和 '123',可以使⽤两层循环,⽣成全排列:
>>> [m + n for m in 'ABC' for n in '123']
['A1', 'A2', 'A3', 'B1', 'B2', 'B3', 'C1', 'C2', 'C3']
翻译成循环代码就像下⾯这样:
版权声明:本站内容均来自互联网,仅供演示用,请勿用于商业和其他非法用途。如果侵犯了您的权益请与我们联系QQ:729038198,我们将在24小时内删除。
发表评论