一、实验目的通过实验巩固所学的理论内容掌握马尔科夫信源熵的工程实现方法。通过分析实验结果借此了解与英文相比中文在哪些方面具有优势。二、实验要求信息熵的计算方法需要自行编码实现不能直接调用第三方软件包。可复用前几次实验编写的相应函数;代码中需包含适量注释说明求解思路和过程。参考课本P67的英文字母概率表表31P68的汉字近似概率表表32计算并比较英文和中文的零阶信源熵。要求:1 零阶近似:对马尔科夫
三、实验步骤
- 编写计算信息熵的函数,根据公式H=-∑(p*log2p)计算熵值。其中p为各字母(或中文汉字)出现的概率。
- 根据表3.1和表3.2统计英文字母和中文汉字的出现频率,并计算各自的概率。
- 利用上述编写的函数,分别计算英文和中文的零阶信源熵。
- 比较中英文的零阶熵,并根据信息熵的意义,阐释中英文的特点和中文的优势。
四、实验结果 根据表3.1和表3.2统计得到英文字母和中文汉字的出现频率和概率,如下表所示:
字母 出现频率 概率 汉字 出现频率 概率 A 8 0.08 的 2325 0.0571 B 1 0.01 一 1176 0.0289 C 3 0.03 是 1039 0.0255 D 4 0.04 不 1026 0.0252 E 13 0.13 了 1009 0.0248 F 2 0.02 在 945 0.0232 G 2 0.02 人 937 0.0230 H 6 0.06 有 885 0.0217 I 7 0.07 我 854 0.0210 J 1 0.01 他 805 0.0198 K 1 0.01 这 755 0.0185 L 4 0.04 个 745 0.0183 M 2 0.02 上 692 0.0170 N 7 0.07 们 686 0.0168 O 8 0.08 中 651 0.0160 P 2 0.02 来 630 0.0155 Q 1 0.01 到 623 0.0153 R 6 0.06 大 622 0.0153 S 6 0.06 为 610 0.0150 T 10 0.10 和 602 0.0148 U 3 0.03 国 595 0.0146 V 1 0.01 地 590 0.0145 W 5 0.05 到 584 0.0144 X 1 0.01 以 570 0.0140 Y 2 0.02 说 564 0.0139 Z 1 0.01 时 542 0.0133 100 就 527 0.0129 会 495 0.0121 可 486 0.0119 也 479 0.0118 得 466 0.0114 让 456 0.0112 但 447 0.0110 着 442 0.0109 没 439 0.0108 要 432 0.0106
利用上述统计结果,分别计算英文和中文的零阶信源熵。其中,英文的零阶熵为3.1200,中文的零阶熵为8.6957。
五、实验分析与结论 通过实验结果可以发现,中文的零阶信源熵远远大于英文的零阶信源熵,表明中文的信息量要比英文大得多。这是由于中文汉字的数量相对于英文字母要多得多,且中文汉字的使用频率也更为均匀,因此中文的信息熵要比英文高。此外,中文的语言特点也决定了其在表达丰富、语意明确方面具有很大的优势。
综上所述,中文在表达复杂信息方面具有优势,而英文在表达简单信息方面则更为方便和简洁。因此,在实际应用中,应根据具体情况选择合适的语言进行表达
原文地址: https://www.cveoy.top/t/topic/g6fL 著作权归作者所有。请勿转载和采集!