社区应用 最新帖子 社区服务 会员列表 统计排行 搜索 银行
  • 1027阅读
  • 0回复

写宋词其实这么简单

楼层直达
级别: 骑士
  一位学习统计学的网友,利用所学将《全宋词》中出现的99个“高频词汇”统计出来,发在博客上。没想到,这篇博文很快就被大量转载,并有网友利用这些高频词汇重新“写词”。圆周率、生日、身份证号码都可以组成一首形式上的“宋词”。 9u^yEqG`  
7&>==|gt  
  在江汉大学刚刚举办的“诗词吟诵暨诗歌大赛颁奖会”上,不少学生讨论这个话题。真的存在网友说的“自动写词机”吗?记者展开采访调查。 ~1g)4g~  
c_Fz?R+f?K  
  《全宋词》中的99个高频词汇 1<n'F H3  
hVLV Mqd  
  话题的“始作俑者”是一位学习统计学的研究生,网名“yixuan”,他在博客上发表一篇文章:“突然想看看宋词里面什么样的意象是最常见的,比如可以做个频率分析什么的。当然文本挖掘需要分词,我没法在其中花太多时间,于是想出了一个土办法。” 8n~ o="  
L_(Y[!  
  宋词的句子都很短,最常见的词语一般是两三个字,这样可能的组合就更少了。比如“犹解嫁东风”这句话,可能的二字组合是“犹解”“解嫁”“嫁东”“东风”,三字组合是“犹解嫁”“解嫁东”“嫁东风”,词的字数越多,可能的组合就越少。 6EY W:o  
'1NZSiv+C?  
  “yixuan ”统计出99个《全宋词》中的高频词汇。排在前面的依次为“东风(1382次)、何处(1230次)、人间(1202次)、风流(857次) 、归去(812次、)春风(802次)、西风(779次)、归来(771次)、江南(765次)。 9_&N0>OF  
'6zk> rN  
  “yixuan ”的这篇博文一发出来,很快就被另外一家网站转载,大量网友被这个有趣的话题吸引,纷纷发帖评论。 L8.u7(-#  
M WHzrqCA  
  高频词汇被演绎成“自动写词机” eZ`x[g%1  
#_9Jam%M  
  在大量评论后面,一位名叫“达芬奇的鸡蛋”发现,利用这些“高频词汇”的代码,可以随意拼凑出一首首宋词来。比如用“圆周率”的数字排序,结果就是:回首明月(一看就是抒情诗) %&\DCAFk  
NB)$l2<d  
  悠悠心事空 (! "+\KY  
-_p@I+B  
  西湖何事寂寞中 ?'%9  
wNtPh&  
  风吹斜阳匆匆 _fmOTz G  
: kw14?]_  
  芳草平生斜阳 f J$>VN  
{Ip)%uR  
  风吹寂寞今日 ^oH!FN`;{  
Z0!yTM/C  
  一枝富贵年年 3+tr_psH  
2y` :#e`x1  
  断肠长安不知 bG&vCH;}%  
r6 :c<p[c  
  一时间,众多网友用自己的身份证号码、各种数字组合来“写宋词”。如网友“叶绿彘”的“作品”是:“东风何处?人间风流。归去春风,西风归来。江南相思,梅花千里。回首明月,多少如今?阑干年年万里,一笑黄昏当年……” biy[h3b  
csCi0'u  
  记者用多位同事的身份证号码、生日号码等,套用这些代码,果然也能产生出一首首有模有样的“宋词”。 i8 fUzg)  
/}&@1  
  原意不是为了“写词” MgG_D6tDM  
fF.qQTy;7  
  看到帖子被大量转发,“yixuan ”在自己的博客上又写了一篇解释,他说,“自动写词机”并不是我的创意,也不是我的初衷。 0OF]|hH  
;UoXj+Z  
  “yixuan ”说:“我学的专业是统计和精算,平时会和各种类型的数据打交道,之前写那篇博文也是出于兴趣,想利用学到的专业知识来对一些实际问题进行分析。” OdHl)"#  
OaCp3No  
  他说,很多人肯定都会提到“自动写词机”,就比如拿生日、QQ、物理常数等套用里面的排序来“写词”。但我想说的是,这其实不是我的创意,也不是我写那篇博文的初衷。如果大家看过那篇转帖,就会发现大家开始“狂欢”是因为“达芬奇的鸡蛋”的创意,而词频统计本身并没有任何特殊之处。 Wt $q{g{C  
w W1>#F  
  事实上,大家可能听说过“文本挖掘”这个名词,它就是对文本数据进行分析,来得到有用的结论。文本挖掘是个很复杂的过程,牵涉到分词、词频统计、特征选择、聚类等等,如果大家对这一块内容有所了解的话,就会知道词频统计是一个很平凡的过程。 /aX#j`PrH  
; +%|!~  
  “yixuan”说:可能有些朋友觉得我得到宋词的词频是一件技术含量很高的活儿,但从技术层面上来讲,我做的那些东西也并无任何高级之处(当然需要有一些编程经验)。 /Z m5fw9  
+8eW/Bs@2  
  只是一个文字游戏 UukHz}(E  
K.I  \E  
  这99个“高频”词汇真的有那么神奇?昨天,武汉大学文学院博导王兆鹏教授看了后评论说:“这只是一个文字游戏”。 n1+,Pe*)  
t}A n:  
  王兆鹏说,汉语语言中,诗词的语序不需要确定性,同时汉语语言具有多义性。很多词语组合起来,都可以说得通。比如我们说“吃饭”大家能听懂,但说“饭吃”,也能理解是怎么回事。 ]YqeI*BX  
a]nyZdt`  
  从严格意义上说,通过这99个编码做成的“词”,平仄完全不符合要求,也不符合词牌的要求。但形式上挑不出什么毛病,也有一点词的味道。 #`Gh8n#  
r5(-c]E7  
  王兆鹏说,宋词是一种文学艺术,讲究独创性和意境,读者通过读诗词能够看到里面的意境,这是艺术。“如果写词这么容易,那谁都可以写词了。” mvrg!/0w  
I$vM )+v=  
  不过,王兆鹏也认为“yixuan ”的做法很有创意,“能从这么多词中总结出99个高频词汇,是需要花功夫的,也说明这个学生很努力,这是一个比较高级的文字游戏,虽然谈不上有什么文学意义。” WlfS|/\%V^  
&bw ``e&c  
  中南财经政法大学统计与数学学院博导李占风教授说,利用统计学原理确实可以在诗词等文学作品中,做一些研究工作,这位学生学以致用,值得表扬。 "F8A:tR  
快速回复

限150 字节
批量上传需要先选择文件,再选择上传
 
上一个 下一个