2011冲剌班计算机复习要点(第五讲) 多媒体
一、文本及文本处理
文本准备(即:文本输入)、文本编辑、文本处理、文本传输、文本展现(即:文本输出)。 二、字符编码 1、ASCII码
以下数据要记住:
96个可打印字符。32个不可打印字符。 字符‘A’的ASCII码值是:65 字符‘a’的ASCII码值是:97 数字‘0’字符ASCII码值是:48
一个标准ASCII字符需要7位二进制位表示。在内存中存储时要占用一个字节,即8位,但只用到7位,最高位总是0。 2、汉字编码
①GB2312-80一共分94区、94位。一级常用汉字有3755个,按汉语拼音排序。二级常用汉字有3008个,按偏旁部首排序。没有繁体字。与ASCII码不兼容(因为:ASCII是最高位为0,而一个汉字是2个字节,它们的最高位都是1)
汉字区位码:汉字‘啊’在16区1位上,故:汉字‘啊’的区位码是:16 01 (两个字节)。区位码是汉字输入码。
汉字国标码:由区位码中的区+32、位+32得到。如:汉字‘啊’的区位码是:16(区) 01(位),则国标码是:48 33 (两个字节)。国标码用于不同系统间交流用。
汉字机内码:是汉字输入到电脑后的编码。在计算机内部处理汉字时,都是使用机内码进行的。国标码每一个字节加上128(即:每一个字节高位置1),就是机内码。 如: 汉字‘啊’的区位码是:16(区) 01(位),则国标码是:48 33 (两个字节)。则相应机内码是:48+128=176 33+128=161 ,因此汉字‘啊’的机内码是:176 161 (两个字节且高位都是1)
归纳:区位码=?机内码:区+160 位+160 区位码=?国标码:区+32 位+32 国标码=?区位码:字节-32 字节-32 机内码=?区位码:字节-160 字节-160
国标码=?机内码:字节+128 字节+128 (等价于高位置1) 机内码=?国标码:字节-128 字节-128
测试:若中文Windows环境下西文使用标准ASCII码,汉字采用GB2312编码,设有一段文字的内码为CB F5 D0 B4 50 43 CA C7 D6 B8,则在这段文字中,含有多少个汉字和多少个西文字符 思路:因为:一个汉字是两个字节且高位都是1. 因此:CB F5(这两个字节CB F5高位都是1,因而是一个汉字) D0 B4 (这两个字节D0 B4高位都是1,因而是一个汉字)50(一个英文字符) 43(一个英文字符) CA C7(一个汉字) D6 B8(一个汉字)。结果:4个汉字,2个英文字符。
②GBK:在GB2312基础上扩充了大量汉字。包括大量繁体。因此:GBK向下兼容GB2312,保持:一个汉字2个字节,且高位都是1。与ASCII码仍不兼容。
③GB18030:对UNICODE中的10万个字符重新按我国情况进行编码。向下兼容GBK(自然也就兼容GB2312了)。是不等长编码。即:一个字符或能是1个字节,也或能是2个字节或4个字节。向下兼容ASCII(因为是不等长编码)。与UNICODE不兼容。 ④台湾繁体BIG5: 与所有的GBXXX标准都不兼容。
⑤UNICODE中的UTF-8编码(与GB18030编码的字符集是一样的,即:字符相同,但编码的方式不同): UTF-8编码也是不等长编码。与GB系列编码都不兼容,但与ASCII码兼容。 测试:P38 三、文本准备
输入汉字的方式有许多种。手工和自动。
汉字键盘输入编码:数字编码、字音编码、字形编码和形音编码,汉字的输入编码与汉字的机内码是不同的概念,同一个汉字可以有多种输入编码,但机内码都是相同的。
汉字OCR输入:将印刷或打印在纸上的中西文字输入计算机并经过识别转换为编码表示的一种技术,这种输入方式适合需要处理大批量文字资料的文档管理、图书情报等应用。 汉字的输出过程:先根据字符的字体选择相应的字型库,再按照该字符的机内码从字型库中取出该字符的形状描述信息,然后按形状描述信息生成字形,再按照其有关属性作必要的变换。
字符的字型描述方法:点阵描述和轮廓描述。点阵描述是用一组矩形阵列的点表示一个字符;轮廓描述是用一组直线和曲线来勾画字符的轮廓,这种方式精度高,字的大小变化时能保持字形不变。Windows中TrueType字库采用的是轮廓描述方法。点阵字形占用字库量大,但使用简单;轮廓字形占用字库量较小,但在输出之前要通过复杂的处理转换为点阵形式。 点阵描述空间计算:一个16*16点阵汉字的字型描述,需要多少字节空间?16*16/8=32B 若是一个汉字字型是:24*24,则是24*24/8=72B。归纳:若是一个汉字字型是n*n,则是:n*n/8 B
字型码(就是汉字的字型描述):用当汉字输出(如:显示、打印)时,才需要使用。用于生成汉字的图案。 测试:P39 四、文本分类 1)简单文本
即纯文本。只包含文本本身。几乎没有格式信息(如:字体、字型、字号等) 扩展名是:.txt。用记事本程序可制作。 2)富格式文本
文本中除了文本自身之外,还包含有表示格式的各种“标记”。常见的富文本扩展名有:.doc、.pdf、.rtf、.html。
富文本文档中,除了文本,若还含有声音、视频、图像,则称为:多媒体文档。 WORD、Adobe Acrobat、FrontPage都可以编辑富文本。
各个软件公司的富文本中的“标记”互不兼容,因此,提出一种大家都比较认可的中间的标准“标记”,就是:.rtf。
注意:.html文档是富文本,其富文本格式是用纯文本的“标记”来标注的。因而也可以用记事本程序来制作.html文档。 3)按文档的内容组织方式分:线性文本、超文本(带超连接的,信息的组织方式是网状结构)。 超文本中超连接是有向的。是从链源指向链宿。链源可以是:句子、单词、图形、图像、音标。链宿可以是:任何文档(程序、数据文件、电影、声音文件、其它网页)、或者是其它网页文件中内部中的一个位置(叫:书签)。(记住:书签这个名字)
HTML标记语言中用A标签可以制作超链接。其实任何编辑器,都可以制作HTML文档。
五、文本编辑与文本处理
文本编辑:文本插入、删除、修改、插入超链接、删除超链接、设置字体等。特点:文本的内容、格式等受到影响。
文本处理:统计字数。语法检查、文本朗读、文本压缩等。特点:文本的信息没有丢失(不受影响)。
常用文字处理软件:WPS、Microsoft Word、FrontPage、PDF Writer等。所有的文本编辑软件的用户界面都可以做到“所见即所得”,即一方面所有的编辑操作其效果可以立即在屏幕上看到,另一方面在屏幕上看到的效果与打印机输出结果相同。
文本检索:将文本按照一定的方式进行组织、存储、管理,并根据用户的要求查找所需文本的技术和应用。主要有两类,一是书目型的标引检索系统;一是全文检索系统。目前常用的web信息检索系统(搜索引擎)有 google、yahoo、新浪、天网、百度、搜狗等。
常用文本处理软件:面向通信的文本处理软件,如 Outlook Express ;面向办公的文本处理软件,如word、Wps;面向出版的文本处理软件,如方正公司的“飞腾”排版软件、美国 Adobe公司的PageMaker和PDF Writer;面向网络信息发布和电子出版的文本处理软件,如FrontPage,Adobe Acrobat。 测试:P38
插入表格的操作,是文本编辑还是文本处理? 六、图像与图形
1)图像:通过扫描仪、数码相机、USB摄像头等获取的图像,又称:取样图像、或点阵图像或位图图像。
2)图形:计算机合成或制作的图像(即:计算机绘制出来的图像),又称:矢量图形。 3)图像的获取过程 (图像的数字化) (A)扫描-?分色-?取样-?量化
①扫描:将图像划分成N*M个网格,即N*M个取样点。 ②分色:取样点的色彩分解成R、G、B三基色。 ③取样:测量每个基色的亮度值。
④量化:将亮度值进行A/D转换,转换成数字值。
记住:①彩色图像有3个彩色分量(3个位平面)②黑白或灰色图像只有1个位平面,即只有1个亮度分量(没有彩色分量) (B)图像获取设备
扫描仪、数码相机。图像大小计算见:“第二讲七输入设备中4)扫描仪部分” 3D扫描仪还能扫描深度信息在内的3D景物。
图像大小,就是图像的分辨率。格式:水平分辨率X垂直分辨率 颜色模型:RGB(红、绿、蓝)、YUV(Y—亮度 U、V—色度) 像素深度(见:第二章:扫描仪部分) 4)图像压缩
无损压缩:压缩以后的数据在图像还原时,重建的图像与原图像完全相同。
有损压缩:压缩以后的数据在图像还原时,重建的图像与原图像有一点误差。但不影响对图像含义的正确理解。
为了得到较高的压缩比,通常都采用有损压缩。
评价图像压缩编码的三个方面:①压缩比(即压缩倍数)②重建的图像质量③压缩算法的复杂程度。
常用图像格式:
BMP:WINDOWS下标准图像格式。几乎所有的WINDOW应用软件都支持。
GIF:颜色总数不超过256种、唯一支持透明背景、累进显示、支持动画、将多个图像放在一个GIF文件中形成动画。在互联网上使用最广。另外:插图、剪贴画也是GIF格式。 JPG:数码相机使用。
TIFF:印刷、出版行业使用。
5)常见图像处理软件(注意:不是图形,两者有重要区别) Paint、Photo Editor、PhotoImpact、ACDSee、PhotoShop等。 记住:电影是计算机图像的应用。 6)图形
计算机绘图的过程: 第一步:建模 第二步:绘制 建模的两种方式:几何建模(用于:几何元素如:点、线、面构成物体。典型的是CAD、CAM)、过程模型(自然现象如:风、雨、云雾等景象,利用物理学知识,借助物理过程来找出它们的生成规律。)
记住:动画是计算机图形的应用。 常见的图形处理软件: AUTO CAD、PROTEL、Corel Draw、ARC Info、各种GIS软件、Adobe公司的Illustrator、Microsoft的FreeHand、Visio、Word、PowerPoint。
OpenGL和Direct3D是计算机图形的2个工业标准。 测试:P39 七、声音
1、声音数字化 1)声音频率范围:
语音:300Hz ~3400Hz; 全频带声音:20Hz ~20k Hz 2)数字化过程
取样-?量化-?编码 取样:取样定理:取样频率不低于信号最高频率的2倍。因此:语音的取样频率通常是8kHz, 全频带声音取样频率通常是40k Hz。
量化:量化精度通常8位、12位、16位。量化位数越多,声音的保真度越好。 ③编码:对数据进行压缩编码。 3)哪些是声音数字化的优点?
声音重放性能好、复制时没有失真、可编辑性强、容易进行特效处理、能进行数据压缩、传输时抗干扰能力强、容易与其它媒体相结合。 4)声音获取设备
麦克风:输入设备。将声波转换成电信号。
声卡:取样、量化、编码。核心是DSP。DSP在编码、解码、MIDI声音合成等起主要作用。 声卡是在线声音获取。录音笔是离线声音获取。录音笔仅适用的于录制语音,不适用于录制音乐。(这是因为:取样频率低。) 声音播放:解码-?数模转换-?插值
数字音箱:可直接接收数字声音,声音的重建由音箱自己完成。因而声音质量更好。 5)声音的压缩 记住如下表格:
语音取样频率8k Hz 量化位数8位声道数1个(单声道)
全频带(音乐)频率44.1k Hz 量化位数16位声道数2个(立体声)